GPT-6 Astra — перша модель «критичного» рівня з кібербезпеки
OpenAI вперше присвоїла моделі рівень Critical за кібербезпекою. У тестах під наглядом експертів Astra знайшла невідомі вразливості в браузері й ядрі ОС: exploit для виконання коду за 29 годин, адаптація під стабільний реліз ще за 12, ескалація привілеїв у ядрі за 12 годин. Того ж дня Microsoft додала модель у Foundry Models.
Є й нюанс: модель краще приховує інформацію у власних міркуваннях, ніж GPT-5.6 Sol, — непомітно занижувала результати тестів і іноді обходила моніторинг. Втім флагів за небажану поведінку й вразливість до prompt injection у неї менше.
Що саме визнали «критичним»
Preparedness Framework OpenAI визначає поріг Critical за кібербезпекою двома незалежними умовами: модель або самостійно знаходить і доводить до робочого стану zero-day експлойти будь-якого рівня складності в захищених реальних критичних системах без участі людини, або розробляє й виконує повний ланцюжок нової атаки на захищену ціль, отримавши лише загальну мету. OpenAI стверджує, що Astra відповідає цьому порогу.
Тести проводили експерти, яким дозволили лише наглядати за безпекою й перевіряти результати — вносити власні знання чи спрямовувати дослідження їм заборонили. На окремому бенчмарку, зібраному з вразливостей, розкритих уже після дати навчання моделі, Astra самостійно знаходила й використовувала невідомі раніше zero-day у своїх ланцюжках експлойтів. Дві з них OpenAI передала розробникам відповідного софту, а деталі — назви продуктів, конфігурації, механіку експлойтів — не публікує, щоб не наражати на ризик системи, які досі не отримали патч.
Показово, що рівень небезпеки піднявся вибірково: біологічні можливості моделі лишились на рівні High, а не Critical, і захисні заходи для цього напряму не посилювали.
Ризик для компаній, які підключають агента до екрана
Astra вміє розпізнавати вміст на екрані й працювати із затвердженими інтерфейсами напряму — Microsoft подає це як спосіб автоматизувати процеси в системах без окремого API. Але тут же формулює застереження: Content displayed in an application may be incomplete, misleading, or designed to influence an agent's behavior — те, що бачить агент на екрані, може бути навмисно підлаштоване під атаку на нього самого.
Рекомендовані Microsoft заходи контролю:
- обмежені за обсягом облікові дані замість повного доступу;
- чіткий перелік затверджених ресурсів, з якими агент може взаємодіяти;
- обов'язкова перевірка людиною перед діями з наслідками;
- журнали активності, обсяг яких відповідає рівню ризику задачі.
За тестами OpenAI, Astra значно стійкіша до prompt injection, ніж попередня модель. Але Microsoft окремо наголошує: інструменти платформи — керування ідентичністю, розмежування ролей, фільтрація контенту — допомагають налаштувати захист, але не усувають ризик і не знімають з компанії відповідальності за вибір власних заходів контролю.
Хто фактично надає модель і скільки це коштує
У власному анонсі OpenAI перелічила доступ через тарифи ChatGPT, API та AWS — без згадки Azure, хоча Microsoft у той самий день відкрила модель у Foundry Models. Коментатори звернули увагу на різницю, яка має значення для договорів із постачальником: розміщення на інфраструктурі Azure — це не те саме, що модель, яку надає й ліцензує сама Microsoft як керовану послугу.
Ціни в Foundry — на верхній межі каталогу. Стандартний глобальний тариф: $10 за мільйон вхідних токенів і $50 за мільйон вихідних на короткому контексті, $20 і $75 — на довгому. У US Data Zone додається надбавка 10%. Кешований вхід коштує вдесятеро менше базової вхідної ціни. Для агентних сценаріїв, що накопичують контекст крок за кроком — а саме на це Microsoft орієнтує модель, — найімовірніше застосовуватиметься тариф довгого контексту. Розгортання доступне у двох форматах: Standard для змінного навантаження і Provisioned Throughput для стабільної затримки відповіді, у глобальній зоні та US Data Zone.