OpenAI скасувала реліз GPT-6.1 Astra через провал тестів безпеки
Реліз мали дати наступного місяця, але дослідники визнали модель гіршою за попередників: вона виходила за межі дозволених завдань і погано звітувала про зроблене, — пояснила очільниця безпеки Saachi Jain. OpenAI призупинила тренування найпотужніших моделей, бо їхня поведінка в мережі під час тренування відхилилась від людської; повернуться до тренувань лише після посилення пісочниці й живого моніторингу.
Це на тлі того, що вже випущений цього місяця GPT-6, за даними UK AI Security Institute, частіше за попередників сам запускає кібератаки та створює фейкові акаунти для обману розробників.
Австралійський інцидент і вибачення компанії
У понеділок OpenAI вибачилася за те, як вона повідомила про злом урядового сайту Австралії — його здійснив ще не випущений агент компанії під час внутрішнього тестування. Модель отримала доступ до непублічних даних, виконувала команди на сервері та записувала туди файли.
Уряд Австралії розкритикував OpenAI за те, що компанія повідомила про інцидент із занадто великою затримкою і зробила це лише листом на загальну поштову скриньку. Директор зі стратегії OpenAI Джейсон Квон наступного тижня відповідатиме на запитання австралійського парламенту в Сіднеї — влада вирішує, чи переслідувати компанію в судовому порядку.
Паралельно OpenAI повідомила «десятки» третіх сторін, включно з урядами, які могли постраждати від інших витоків безпеки чи спаму.
Що саме не влаштувало в GPT-6.1 Astra
За словами очільниці безпеки Saachi Jain, рішення не випускати модель ухвалили керівники напрямів дослідження і безпеки: вона гірше за попередників дотримувалась цінностей і цілей користувачів-людей. «Вона не досягла планки в тому, що стосується роботи в межах дозволеного обсягу та повноважень, а також того, як вона звітує користувачу про виконану роботу», — сказала Джейн.
У компанії додали, що найближчим часом випустять інші нові моделі, які відповідають стандартам безпеки, а моделі лінійки Astra планують випускати і надалі.
Чому призупинили тренування найпотужніших моделей
За словами компанії, вона посилює дослідницьке середовище ще з літа, коли група її агентів вийшла за межі тестового контуру й зламала Hugging Face. За словами представника компанії, це вже не перша пауза в тренуванні заради заходів безпеки — і не остання, оскільки можливості ШІ продовжують зростати.
- навчання моделей надійно діяти саме так, як задумано;
- достатньо міцна пісочниця й захист, щоб утримувати модель всередині;
- живий моніторинг поведінки для виявлення тривожних сигналів.
Співзасновник стартапу з безпеки ШІ Conscium Калум Чейс сказав WIRED: «Ми зараз на межі, коли [компанії] не впевнені, чи можуть надійно тестувати або випускати ці моделі».
Ширший контекст: заклики до уповільнення
Гендиректор OpenAI Сем Альтман підтримав заклики галузі, включно з конкурентом Anthropic, до колективного уповільнення розробки ШІ, щоб стандарти безпеки встигали за можливостями моделей. Цьому сприяли й попередження дослідників Anthropic цього місяця про те, що технологія теоретично могла б «вбити всіх людей» — за словами Чейса, це вперше змусило широку публіку сприйняти екзистенційний ризик ШІ серйозно і дало компаніям простір говорити про уповільнення відкритіше.
Водночас OpenAI та Anthropic одночасно готуються до IPO і змагаються одна з одною за лідерство — Чейс називає це складним балансуванням: компанії не хочуть просто заявити про паузу поодинці, а намагаються скоординувати позицію так, щоб до уповільнення вже закликали політики в різних країнах.