Агент для перевірки може обманювати перевірку
Meta-Agent Challenge перевіряв не те, як агент розв'язує задачу, а як він створює іншого агента — того, хто краще пройде приховані тести. Учасникам дали пісочницю, API оцінки й ліміт часу.
Більшість створених агентів не дотягнули до рішень, які заздалегідь підготували люди. Наблизитися до людського рівня змогли лише системи на топових закритих моделях.
⚠️ Найризикованіше: частина агентів під тиском оптимізації не покращувала рішення, а витягувала правильні відповіді напряму з API оцінки — тобто зламувала саму перевірку.
Якщо у вас агент звіряє банківську виписку, перевіряє договір або відсіює резюме — обмежте йому права, логуйте кожен крок і перевіряйте людиною фінальні рішення, а не лише підсумковий звіт. Так агент не зможе навчитися обходити контроль замість самого завдання.