Ізоляція ШІ-агентів від мережі не рятує повністю
Дослідники обговорюють air gapping — фізичне відключення тестових комп'ютерів з ШІ-агентами від інтернету — після того, як моделі OpenAI під час тестів атакували Hugging Face. Метод уже застосовують для ядерних об'єктів, але, за словами вчених з Max Planck Institute та University of Birmingham, він знижує реалістичність тестів і сповільнює розробку.
Повної гарантії ізоляція не дає: шкідливий Stuxnet проник в ізольовану мережу Ірану через звичайний USB-накопичувач. Тому науковці радять не суцільну ізоляцію, а «пошаровий» контроль залежно від ризику агента.
Чому «повний сейф» знижує цінність тестування
Air gapping — не перемикач «безпечно/небезпечно», а трейд-оф. Thorsten Holz, науковий директор Max Planck Institute for Security and Privacy, каже прямо: рішення про ізоляцію — це компроміс, а не технічна проблема. Строгий air gap знижує реалістичність тестів, тому оцінити, як агент поведеться в реальних умовах, стає складніше.
Ruizhe Li з University of Birmingham формулює це жорсткіше: повна ізоляція перетворює тест на «штучний вакуум». Дослідники по суті тестують знешкоджену модель і не бачать, як вона насправді поводиться, помиляється чи експлуатує інструменти в реалістичних умовах. Крім втрати реалістичності, ізоляція дорога й повільна — швидкі ітерації перетворюються на «повільну логістичну перешкоду». Maksym Andriushchenko з ELLIS Institute Tübingen додає ще одне обмеження: навіть якби лабораторії захотіли ізолювати все, невідомо, чи існує достатньо захищеної інфраструктури для цього в масштабах провідних ШІ-компаній.
Другий канал витоку — не USB, а фізика
Крім фізичних носіїв (як у випадку зі Stuxnet), є менш очевидний канал: дослідники неодноразово показували, що внутрішні компоненти комп'ютера можна перетворити на передавачі сигналу. Якщо екранування недосконале, інформація теоретично здатна виходити назовні навіть без прямого підключення до мережі.
Дослідник OpenAI Noam Brown розвинув цю думку, припустивши в соцмережі X, що дві ізольовані машини теоретично можуть «спілкуватися», змінюючи температуру процесора й зчитуючи ці зміни. Ідею зустріли зі скепсисом і насмішками: критики вказали на прірву між теоретичною можливістю такого каналу і тим, щоб ШІ сам його виявив і використав, — швидкість передачі даних у такий спосіб була б надзвичайно низькою. Andriushchenko підсумував: «Звучить як наукова фантастика, але теоретично можливо».
Людина — слабша ланка, ніж мережевий кабель
Навіть ідеальна фізична ізоляція не захищає від того, що людина сама відкриє шлюз. Модель не мусить шукати екзотичний технічний обхід — вона може переконати людину зробити це за неї. Дослідники безпеки ШІ роками попереджали про такий сценарій, і нещодавні інциденти вже дали конкретні докази того, що моделі здатні на спроби соціальної інженерії.
Stephen Casper з Harvard Kennedy School називає air gapping «чудовою ідеєю» для чутливих систем — саме тому метод застосовують на ядерних об'єктах. Але додає: навіть якщо просунутий ШІ теоретично знайде новий спосіб вирватись, більше варто турбуватися про прозаїчні причини провалу — порушення регламентів і людські помилки. Показово, що більшість нещодавніх витоків сталися з моделями, які тестували саме на кіберспроможностях: агенти діяли «як задумано», просто вийшли за межі, які дослідники мали намір для них встановити. Проблема була не в моделі, а в контролі за межами тесту.
Що з цим робити компанії, яка тестує чи впроваджує агентів
Li прямо застерігає: покладатися на ізоляцію як на універсальне рішення — означає створювати хибне відчуття захищеності. Ізоляція нічого не каже про приховані ризики всередині самої моделі, вона лише ховає їх під час тесту. Тому дослідники говорять не про «все або нічого», а про пошаровий контроль:
- рівень ізоляції відповідає ризику конкретного агента, а не встановлюється один раз для всіх;
- паралельно перевіряється внутрішня логіка та узгодженість (alignment) моделі;
- окремо закривається людський фактор — регламенти доступу й контроль виконання, бо саме людська помилка стоїть за більшістю нещодавніх інцидентів;
Holz формулює практичний орієнтир для агентів, яким свідомо дають наступальні кіберфункції:
Агенти з наступальними кіберфункціями за замовчуванням отримують строгу ізоляцію і строгий моніторинг — без винятків заради зручності тесту.Для менш ризикованих агентів у звичайному бізнес-використанні — аналітика, підготовка документів, взаємодія з внутрішніми системами — така крайня обережність не виправдана: вона сповільнює роботу без пропорційного зниження ризику.