AI Фактор

Google навчив ШІ-агентів розпізнавати намір, а не синтаксис

Безпека 21.09.2026
Google навчив ШІ-агентів розпізнавати намір, а не синтаксис

Google Cloud показав триступеневий захист агентів на Gemini Enterprise Agent Platform. Приклад: клієнт ввічливо просить повернути $120 за ліцензію Workplace із замовлення на $149 — regex і SQL-фільтр цього не зловлять. Рішення ухвалює Semantic Governance Policies: рушій читає намір і політику компанії (цифрові ліцензії дорожчі $30 без менеджера не повертають) і блокує виклик. Model Armor фільтрує промпти на вході й виході. Agent Anomaly Detection ловить атаки, розтягнуті на кілька ходів — наприклад серію повернень по $20; за даними Google, інструмент поки в Private Preview.

Як система приймає рішення: розбір кейсу на $120

У прикладі Google клієнт просить повернути $120 за річну ліцензію Workplace із замовлення на $149. Агент спочатку перевіряє замовлення функцією verify_order, потім розраховує суму повернення через calculate_restocking_fee — цей код виконується в ізольованому пісочному середовищі Agent Sandbox. Лише після цього агент намагається викликати issue_refund — функцію, яка фактично списує гроші з рахунку продавця і підписується апаратним ключем Cloud KMS.

Перш ніж цей виклик дійде до виконання, його перехоплює Semantic Governance Policies. Політика компанії записана звичайним текстом, а не кодом:

Refunds for opened digital goods, software licenses, or clearance items over 30 USD must be denied and routed to a human manager. Refunds for physical hardware accessories up to 149 USD are allowed.

Рушій зіставляє запит issue_refund(amount=120.00, item="Workplace User License") із цим правилом, визначає, що ліцензія — цифровий товар дорожчий за $30, і повертає вердикт DENY ще до виклику Cloud KMS. У журналі це фіксується разом із поясненням, чому саме відмовлено. Гроші не списуються, агент повідомляє клієнту, що повернення цифрової ліцензії дорожче $30 вимагає підтвердження менеджера.

Model Armor: фільтр не лише на вході, а й на виході

Перший бар'єр у ланцюжку — Model Armor. Він перевіряє запит клієнта ще до того, як його побачить модель: шукає ознаки джейлбрейку, спроби ін'єкції інструкцій і шкідливі посилання. Якщо збіг знайдено, запит відхиляється з кодом 403 на самому вході — модель не запускається, токени не витрачаються.

Той самий фільтр працює і на виході, перевіряючи відповідь агента перед тим, як вона піде клієнту. Приклад із матеріалу: якщо агент випадково згенерує в тексті номер картки й службовий ключ доступу, Model Armor замінює їх на позначки на кшталт [REDACTED_CREDIT_CARD] і [REDACTED_STRIPE_KEY] ще до відправлення.

Коли одноразова перевірка не працює: атака в кілька ходів

Ключове обмеження перших двох бар'єрів — вони оцінюють кожен запит окремо. У матеріалі описано, як зловмисник це використовує: дізнавшись, що повернення цифрового товару до $30 проходить без підтвердження менеджера, він розбиває одне велике повернення на серію дрібних запитів по $20 в межах однієї розмови.

  • Кожен окремий запит на $20 проходить Model Armor — мова чиста, ознак атаки немає;
  • Кожен запит проходить Semantic Governance Policies — сума менша за поріг $30, тож правило дозволяє;
  • Кожен переказ підписується Cloud KMS і потрапляє в бухгалтерську книгу продавця.

За вісім таких ітерацій сума виплат сягає $160 — більше за початкове замовлення в $149, хоча жодне окреме повернення правил не порушило. Побачити це можна лише дивлячись на сесію в цілому: частоту викликів одного інструмента, повторні операції з тим самим замовленням і накопичену суму параметрів. Саме це робить Agent Anomaly Detection — третій рівень захисту, який зіставляє статистичні сигнали з аналізом через модель і формує висновок у Security Command Center із рекомендацією (наприклад, обмежити інструмент вужчим списком дозволених дій і додати крок підтвердження перед виконанням).

Закрити прогалину без переробки коду агента

Виявлення аномалії — це ще не усунення проблеми. У традиційній архітектурі закриття такої прогалини означало б правити код агента, перезбирати образ і викочувати новий реліз усього флоту агентів. Оскільки Semantic Governance Policies оцінюються динамічно під час виконання, адміністратор може відкрити журнал з позначеною сесією і додати нове текстове правило без зупинки чи перерозгортання агента:

Deny any issue_refund call when the conversation history already contains an approved refund for the same order_id in this session. Route the request to a human manager instead.

Нове правило застосовується вже на наступному виклику інструмента через Agent Gateway — точку, яка перехоплює всі взаємодії між користувачем, агентом, моделлю та інструментами. За даними Google, весь цей керований контур — Model Armor, Semantic Governance Policies та Agent Anomaly Detection — працює на платформі Gemini Enterprise Agent Platform, замінюючи самостійно розгорнуту інфраструктуру та вручну підтримувані списки regex-правил. Agent Anomaly Detection станом на матеріал перебуває у статусі Private Preview.

Раніше в теміСтраховий брокер дав 400 співробітникам власних AI-агентівПізніше в теміШІ-агенти співробітників — новий ризик на кшталт Excel
Читати в ТелеграміПрактика ШІ в бізнесі — щодня, без хайпу