AI Фактор

Чому AI-чат бреше про суму 250 контрактів

Новина 30.09.2026
Чому AI-чат бреше про суму 250 контрактів

Портфель 250 договорів по 10–20 сторінок (до 5000 сторінок), і запит «яка загальна сума». RAG-чат бере лише кілька фрагментів, що збігаються з питанням, і рахує суму тільки по них — впевнено й невірно, бо весь масив модель не бачить.

Рішення — не покращувати пошук, а виймати дані в базу: Claude Sonnet 4.6 дістає з PDF 8 полів, Claude Haiku 4.5 незалежно перевіряє. Коли вони розходяться щодо підпису (галюцинація «підписано» на порожньому полі з упевненістю 95–100%), вирок ухвалює Amazon Textract комп'ютерним зором. Дані йдуть в Aurora PostgreSQL, звідти — дашборди й чат.

Звідки взявся сам запит

У матеріалі AWS ситуація описана як типова: директор з контрактів відповідає за сотні, а то й тисячі договорів з постачальниками, і керівництво регулярно ставить одні й ті самі чотири питання — яка загальна вартість портфеля, які контракти вже прострочені, який договір найдорожчий і який підписаний останнім. Поки дані лежать у PDF, аналітик відкриває кожен файл вручну, шукає потрібні поля і переносить їх у таблицю.

За оцінкою AWS, на портфель із 250 контрактів (по 10–20 сторінок кожен) така робота забирає більше тижня — і це ще до того, як прийде хоч один новий договір. Кожне наступне запитання від керівництва означає новий раунд фільтрації, а разом з ним ризик працювати зі застарілими даними або зламаними формулами в таблиці.

Як побудована перевірка даних

Агенти екстракції та верифікації зроблені на Strands Agents SDK — відкритому фреймворку для автономних агентів — і розгорнуті на Amazon Bedrock AgentCore, який бере на себе хостинг, автомасштабування та ізоляцію сесій, тож окремо керувати інфраструктурою під ці компоненти не потрібно. Доступ до контрактів обмежує окремий шар Policy на базі Cedar-правил: агенти й користувачі бачать лише ті договори, на які мають права.

Перш ніж зупинитися на зв'язці Claude Sonnet 4.6 / Claude Haiku 4.5, команда AWS протестувала кілька комбінацій моделей на вибірці з 20 контрактів, вручну розмітивши 160 значень (8 полів на договір) як еталон. Точність найбільше залежить від моделі-екстрактора: сильніша модель тут тримає якість навіть з легшою моделлю-перевіряльником, а слабший екстрактор просідає незалежно від того, яка модель його перевіряє. Найдорожчі моделі не завжди виправдовували різницю в ціні. AWS прямо застерігає: це невеликий спрямований тест на 20 контрактах, а не вичерпна оцінка, і результати залежать від формату та складності конкретних договорів.

Що бачить користувач

Дані з Aurora PostgreSQL підключені до Amazon Quick: дашборди QuickSight вбудовані прямо у веб-застосунок і працюють без кешування, тобто оновлюються одразу, щойно завершується обробка нового контракту. На них — ключові показники (кількість і сумарна вартість контрактів, частка підписаних/непідписаних), таблиця з усіма вилученими полями та окремий розділ з оцінками впевненості обох моделей по кожному полю.

Чат-агент у тому ж інтерфейсі відповідає і на агрегатні запитання через структуровані дані, і на запитання по конкретному документу через базу знань з оригінальними PDF. На демонстраційному наборі з 20 контрактів приклади відповідей виглядають так:

  • «Скільки контрактів і яка загальна сума?» → 20 контрактів, $50 млн
  • «Скільки прострочено і на яку суму?» → 3 контракти, $3,7 млн
  • «Скільки підписано, а скільки ні?» → 17 підписано, 3 ні

Окремо додали статус обробки в реальному часі через WebSocket: користувач бачить, який саме сервіс зараз працює з його контрактом, а не просто чекає результату наосліп.

Вартість і межі рішення

За розрахунками AWS, ШІ-частина обробки (виклики Bedrock і Textract) коштує $0,014 за один контракт — ця змінна вартість зростає лінійно і залишається незначною порівняно з фіксованою вартістю ліцензії Amazon Quick, яка формує основну частину поточних витрат.

Коли дві моделі розходяться в оцінці, а Textract не може розсудити спір (він втручається лише тоді, коли розходиться саме ознака «підписано / не підписано»), AWS рекомендує передавати контракт людині-рецензенту, а не намагатися розв'язати конфлікт автоматично. Той самий підхід — вилучення полів у базу замість пошуку по фрагментах — застосовний і поза контрактами: у закупівлях, юридичному комплаєнсі, страхових справах, кадровій документації та договорах оренди нерухомості. Точної дати запуску та повної вартості ліцензії Amazon Quick в матеріалі немає.

Раніше в теміAnthropic випустила Claude Sonnet 5.5
Читати в ТелеграміПрактика ШІ в бізнесі — щодня, без хайпу