Фінансові агенти ближче до готових файлів
Model ML використовує GPT‑5.6 Sol у фінансових workflow, де агент із брифу та джерел доводить задачу до редагованих PowerPoint і Excel з простежуваними джерелами. У тестах Model ML модель створювала .pptx у 100% випадків проти 76% в Opus 5, проходила gate професійної готовності у 43,3% проти 26,7% і давала 36% менше токенів на Excel workbook, ніж Opus 5.
Це важливо, бо ШІ рухається від «чернетки для аналітика» до останньої милі фінансової роботи: форматування, формули, перевірка чисел і матеріали для review. В одного глобального asset manager bespoke tearsheet скоротився з близько години до 5 хвилин.
Де саме агент закриває останню милю
У матеріалі Model ML йдеться не про генерацію тексту для аналітика, а про весь шлях від короткого фінансового брифу до файлу, який можна відкрити, редагувати й віддати на змістовний review. Агент планує роботу, вибирає інструменти, звіряє докази, виконує розрахунки й маршрутизує кроки до моделі, яка краще підходить для конкретної дії.
Перший робочий сценарій — інвестиційний комітет. Із брифу та джерел агент формує редагований PowerPoint: з графіками, таблицями, візуальною ієрархією та посиланнями на джерела. Слабке місце таких матеріалів — не зовнішній вигляд, а перевірка: цифри мають збігатися, твердження мають вести до джерела, а слайди не повинні бути плоскою картинкою, яку треба перемальовувати.
Другий сценарій — Excel-завдання. Агент може почати з клієнтського шаблону або порожньої книги, зібрати потрібні дані, побудувати формули й логіку на кількох вкладках, а потім застосувати фінансове форматування. Третій сценарій — bespoke tearsheet: у глобального asset manager така збірка скоротилася з приблизно години аналітика до приблизно п’яти хвилин.
Як ставити задачу, щоб результат був не просто чернеткою
Матеріал показує, що якість залежить не лише від моделі, а й від harness навколо агента: доступу до document tooling, data integrations, code execution environments і наборів інструментів, які завантажуються під конкретну задачу. Тому бриф має містити не тільки тему, а й очікувану форму файлу, джерела, тип перевірки та межу відповідальності людини.
- Крок 1: дати агенту початковий запит і джерельні матеріали, а не просити просто підготувати презентацію.
- Крок 2: вказати, який артефакт потрібен: редагований PowerPoint, Excel workbook, фінансова модель або tearsheet.
- Крок 3: вимагати простежуваність: кожне твердження й число мають вести до джерела або розрахунку.
- Крок 4: після генерації перевірити припущення, джерела й повідомлення перед передачею клієнту або deal team.
Формулювання для брифу може бути таким: Підготуй редагований PowerPoint на основі цього брифу та джерел. Збережи зв’язок кожного ключового твердження з джерелом, зроби графіки й таблиці редагованими, а наприкінці перевір структуру, числа та візуальну послідовність. Для Excel: Створи workbook із цих джерел, побудуй формули й логіку на потрібних вкладках, не залишай placeholder, перевір, що очікувані outputs знайдені й книга перераховується.
Що в тестах було сильним, а де межа застосування
У Composite evaluation Model ML перевіряла весь ланцюжок: від фінансового брифу через research і calculations до редагованого deck або spreadsheet. Для PowerPoint дивилися не тільки на факт створення файлу, а й на готовність до професійного review, якість deck, відповідність брифу, ієрархію, консистентність, візуальну якість і читабельність графіків.
Межа застосування видно з самих метрик. GPT‑5.6 Sol дав 100% створених .pptx і вищу professional-readiness rate, але це не означає, що кожен deck можна одразу відправляти назовні: gate пройшли 43,3% випадків. В Excel headline accuracy була високою, outputs знаходилися в workbook, а structure/no-errors/no-placeholder gates були закриті, але fully correct models у GPT‑5.6 Sol були нижчими, ніж в Opus 5 у наведеній таблиці.
Тому прийом не працює як повна заміна фінансового судження. У джерелі прямо сказано: finance professional перевіряє assumptions, sources і message перед поширенням. Якщо задача вимагає фінального рішення, інтерпретації припущень або захисту висновку перед керівником чи клієнтом, людина не може віддати це агенту без review.
Типові помилки під час довіри до готового файлу
Перша помилка — оцінювати презентацію за виглядом. У матеріалі окремо підкреслено: deck може виглядати polished, але провалитися в review, якщо числа неправильні або непростежувані, графіки flattened, а слайди треба перебудовувати. Тому перевірка має йти від цифри до джерела, а не від дизайну до враження.
- Перевірити, чи всі ключові числа мають джерело або формулу.
- Відкрити workbook і переконатися, що він перераховується, а не лише виглядає як таблиця.
- Подивитися, чи немає placeholder і чи знайдені expected outputs.
- Перевірити, чи графіки й таблиці в PowerPoint редаговані.
- Звірити, чи структура відповідає початковому brief, а не відхилилася під час генерації.
- Оцінити message: чи справді висновок витікає з матеріалів, а не просто добре сформульований.
Друга помилка — завантажити в один запит великий обсяг матеріалів і не вимагати процедури звірки. У джерелі є приклад, де агенти обробили virtual data rooms із понад 100 000 rows і hundreds of files в один прохід. Але сам факт обробки не скасовує контроль: для таких workflow потрібні gates на sources, formulas, structure і professional readiness.