Thomson Reuters вклала $40 млн у власну ШІ-модель
Thomson Reuters понад два роки й близько $40 млн витратила на Thomson — юридичну модель на базі Alibaba Qwen3.5-397B. Із них $450 тис. пішли лише на фінальний цикл навчання. Використано менш як 10% власного контенту; першою модель перебере аналіз документів у CoCounsel Legal.
Без внутрішніх даних Thomson набрала 0,53 за фактичною точністю проти 0,65 у GPT-5.4. З матеріалами Thomson Reuters результат зріс до 0,83 проти 0,82. Тобто перевагу дали передусім закритий контент, власні інструменти та робота сотень експертів, а не сама модель.
Що саме створює перевагу
Власна модель у цьому кейсі — не окремий алгоритм, а виробничий контур. Thomson Reuters кілька разів змінювала відкриту базову модель, а поточну версію побудувала на Qwen3.5-397B. Спочатку разом з Imperial College її перенавчили для безпеки, етики та політичної нейтральності. Далі додали власний контент, роботу галузевих експертів і агентне навчання з підкріпленням у корпоративних інструментах.
Звідси два додаткові робочі сценарії. Перший — перевірка цитувань як окреме підзавдання: модель не керує всім процесом, а виконує вузьку операцію всередині багатомодельного продукту. Другий — оновлення професійного продукту: кожна перевірка експерта може стати новими навчальними даними. Компанія накопичує цей результат у власній системі, а не залишає його постачальнику зовнішньої моделі.
Як розкласти рішення по кроках
Перевірку доцільності слід починати не з вибору моделі, а з процесу, даних і вимірювання. У Thomson Reuters спрацювало поєднання закритих масивів Westlaw, Practical Law, Checkpoint і Reuters, сотень штатних фахівців та операцій, де якість можна оцінювати об'єктивно.
- Визначте вузьке масове завдання. Першим обрали табличний аналіз під час перевірки документів у CoCounsel Legal. На великому обсязі менша й дешевша модель має економічний сенс.
- Розділіть модель і доступ до знань. Порівняйте результат лише з вебдоступом, а потім із власним контентом та інструментами. Так можна побачити, що саме дає приріст.
- Перевірте модель у робочому середовищі. Перевага з'явилася не лише від читання матеріалів, а й від практики з власними інструментами.
- Залиште можливість перемикання. CoCounsel Legal залишається багатомодельним, а адміністратори можуть змінювати модель.
Питання для внутрішнього обговорення: Чи маємо ми закриті дані, штатних експертів і процес, у якому якість результату можна виміряти? Якщо хоча б однієї складової немає, кейс Thomson Reuters не переноситься на компанію безпосередньо.
Де власна модель не дає переваги
Без корпоративного контенту Thomson не стала лідером. На Stanford LegalBench вона відстала від Gemini 3.1 Pro і GPT-5.5, на Harvey Legal Agent Benchmark була трохи позаду Opus 4.8, а в міркуванні та особливо програмуванні результат різко слабшав. Спеціалізація не означає універсальної переваги.
Побудова власної системи виправдана для компаній з ексклюзивними даними, великою командою доменних експертів і масштабованою оцінкою якості. Без власних даних або системи перевірки компанія ризикує придбати переважно постійні витрати на підтримку. Донавчання зовнішньої моделі теж має межі: воно може погіршувати загальні здібності, залишає витрати на інференс і залежність від дорожньої карти постачальника.
Що перевірити перед довірою до результату
Типова помилка — читати один підсумковий бал як доказ переваги. У тестах умови були нерівними: Thomson використовувала масштабування під час відповіді, тоді як GPT-5.5 працювала без режиму міркування. Новіші моделі не тестували. Інша помилка — приписати весь приріст спеціальному навчанню, хоча GPT-5.4 із доступом до того самого контенту покращилася майже так само різко.
- Чи однакові моделі, режими міркування, інструменти й доступ до даних у порівнянні?
- Чи перевіряє тест саме робоче завдання, а не загальне міркування або програмування?
- Чи можна простежити цитування та передати сумнівний результат експерту?
- Чи не потрапляють клієнтські дані в навчання? Thomson Reuters заявляє, що не використовує їх для цього.
- Чи зберігається зовнішня модель як резерв, якщо власна програє на конкретному підзавданні?
Контрольне формулювання для приймання: Покажи джерело кожного висновку, познач непідтверджені твердження та передай їх експерту на перевірку.