Агентів треба оцінювати не лише за результатом
У дослідженні McKinsey 2 з 10 серед 1719 респондентів заявили, що їхні організації вже масштабують ШІ-агентів. Контролювати треба три виміри: намір, метод і результат. Трасування фіксує моделі, виклики інструментів, права доступу, джерела даних, передачі між агентами, затримку й токени.
Спочатку — межі завдання і точка відліку
Спостереження за агентом починається ще до його розгортання. Компанія має визначити завдання, критерії успішного виконання, необхідні інструменти й дані, дозволені дії та ситуації, у яких потрібне схвалення людини. Окремо слід зафіксувати бізнес-показник, який агент має поліпшити.
Потрібна й базова величина для порівняння. Наприклад, якщо агента впроваджують для скорочення часу розв’язання звернень, цей показник вимірюють до запуску і продовжують відстежувати після нього. Без заданої мети та дозволених меж телеметрія не покаже, чи справді агент відхилився від очікуваної поведінки.
Що має показувати повний маршрут виконання
Корисне трасування повинно давати змогу відтворити весь процес: хто або яка система ініціювали завдання, як агент змінював план, які повторні спроби робив і що делегував. У системах із кількома агентами важливо бачити, які відомості передавалися між ними, що було пропущено та чи залишався кожен агент у межах своєї ролі.
Такі дані виявляють зміни, які не спричиняють звичайної програмної помилки. Той самий процес може спочатку завершуватися за один цикл, а зі зміною контексту потребувати кількох. Довший маршрут свідчить про можливе зниження ефективності моделі або робочого процесу, навіть якщо підсумкове завдання виконано.
Результат оцінюють на двох рівнях
Перший рівень — технічна правильність. Якщо існує еталонна відповідь або фіксовані критерії, можна застосовувати детерміновані перевірки. Для складніших результатів і трас автор допускає оцінювання за допомогою мовних моделей.
Другий рівень — вплив на бізнес: скорочення часу обробки, збільшення обсягу виконаної роботи, зниження вартості завершеного завдання або поліпшення операційного показника. Технічно справний агент може виконувати багато дій і витрачати кошти, не створюючи вимірюваного бізнес-результату.
- У Planview порівнюють обсяг постачання функцій, тривалість і ефективність потоку робіт із витратами на моделі. За словами виконавчої віцепрезидентки з розробки Бет Вікс, найзріліша агентна команда після додавання спостережуваності досягла утричі більшого обсягу роботи проти попереднього рівня.
- За словами Семюела Галлагера з Egen, аналітика внутрішньої платформи для програмування пов’язала використання окремих навичок агентів із заявленим зростанням ефективності користувачів на 20–40%.
Спостереження не замінює контроль
Трасування допомагає знайти джерело збою — вибір моделі, отримання даних, авторизацію, виконання інструмента, передачу між агентами, оцінювання або фінальну дію. Воно також показує вихід за межі завдання, неочікуваний доступ до даних і незвичні витрати. Але саме по собі спостереження не зупиняє агента: для цього потрібні дозволи, захисні обмеження та засоби реагування.
- Надавати лише ті інструменти й дані, які потрібні для конкретного завдання.
- Підвищувати автономність поступово: від роботи поруч із людиною до рекомендацій, які вона схвалює.
- Залишати рішення з великим впливом на людському контролі навіть після підтвердження надійності агента.
- Використовувати ізольовані середовища, захищені облікові дані та схвалення ризикових дій.
- Підтримувати актуальний реєстр агентів: частина з них може працювати в компанії без реєстрації або підключення до платформи спостереження.
- У багатоагентних процесах зберігати ідентичність, контекст дозволів і передані дані на кожному етапі та не додавати агентів без потреби.