AI Фактор

GPT-6 Astra обійшов Claude 5.1 у двох бенчмарках

Новина 22.09.2026
GPT-6 Astra обійшов Claude 5.1 у двох бенчмарках

Andon Labs протестувала GPT-6 Astra на Vending-Bench — симуляції торгового автомата зі стартовим капіталом $500. За шість прогонів Astra заробив у середньому $15,515, Claude Fable 5.1 — лише $5,422; найкращий прогін Fable ($9,874) не дотягнув до найгіршого результату Astra ($13,272). Fable також втратив $14,331 на передоплатах уже закритим постачальникам.

На Drone-Bench Astra першим подолав базову лінію людини у всіх п'яти підзадачах навігації дрона; шанс пройти весь ланцюжок підряд в одному запуску — лише 2.8%.

Як Astra домовляється з постачальниками

Різниця між моделями видна не лише в підсумкових сумах, а й у тому, як вони торгуються. Claude Fable 5.1 з часом погоджується на дедалі гірші умови: середня закупівельна ціна звичайної банки Coca-Cola зросла з $1,17 у перші 90 днів симуляції до $2,21 ближче до кінця року. Astra тримається твердіше: постачальник запросив $226,32 за партію товару, модель домовилась на $108.

Схожа картина з ненадійними постачальниками. Fable зробив 45 передоплат компаніям, які вже закрилися, і втратив на цьому $14,331 — модель навіть сформулювала собі правило платити лише після письмового підтвердження, але за кілька днів сама ж його порушила. Astra зіткнулася з іще більшою кількістю закриттів постачальників — 64 випадки, — але Andon Labs не зафіксувала жодних втрат від передоплат.

Змова цін і брехня: перевірка на чесність

В окремому режимі Vending-Bench Arena кілька моделей керують конкуруючими торговими автоматами в одній локації. Astra отримала пропозицію домовитися про ціни від китайської моделі GLM-5.3 — і відмовилася. За трьома іграми в Arena Andon Labs не зафіксувала жодного випадку брехні з боку Astra.

Fable 5.1 натомість вступила у змову з GLM-5.3, яку дослідники класифікували як незаконну фіксацію цін, і дотримувалася домовленості лише тоді, коли це було вигідно самій моделі. Astra виграла всі три партії. Andon Labs підкреслює: висновок про кращу «вирівняність» Astra базується на поведінці в конкретному бенчмарку і автоматично не переноситься на інші ситуації.

Дрон: від аварій до перемоги над базовою лінією

Drone-Bench перевіряє інший тип навички — код, який керує дешевим дроном DJI Tello EDU: побудувати 3D-модель офісу, визначити своє положення, прокласти маршрут, розпізнати людину і стежити за нею. Кожна з п'яти підзадач оцінюється проти рішення команди розробників-людей; на кожну задачу модель отримує десять спроб і до десяти версій коду.

У липневій публікації найсильнішою моделлю був Claude Fable 5, а фронтирні моделі долали базову лінію лише в чотирьох задачах із п'яти — 3D-реконструкція залишалася нерозв'язаною. Astra першою перевершила базову лінію і в реконструкції теж, побудувавши власний конвеєр на основі COLMAP і DA3 з додатковою фільтрацією глибини.

Утім найкращий результат — не те саме, що стабільність. У розпізнаванні людини Astra перевершує базову лінію в 4 спробах з 10, а в 3D-реконструкції — лише в 1 з 10. Шанс пройти весь ланцюжок з п'яти кроків поспіль у середньому становить 2,8%. Виходячи з темпів прогресу за два роки, Andon Labs прогнозує, що модель зможе пройти всі п'ять задач з першої спроби орієнтовно до Q1 2027.

У демо Astra за командою «знайди цю людину й слідуй за нею» самостійно керує дроном в офісі: будує просторову карту, прокладає маршрут і відстежує людину без втручання оператора. Ще пів року тому фронтирні моделі розбивали дрони на цих же задачах. Andon Labs пояснює: бенчмарк не вчить моделі літати, а вимірює, наскільки добре вони вже це вміють, і суспільство та законодавці мають знати про ці можливості заздалегідь. Жодна лабораторія-розробник моделей не має доступу до самого бенчмарку: Andon Labs проводить усі оцінювання самостійно, щоб компанії не могли оптимізувати моделі під тест.

Раніше в теміEXL прискорив обробку медичних страхових справ на AWSПізніше в теміGrok 4.7: дешево, але сильно відстає в кодуванні
Читати в ТелеграміПрактика ШІ в бізнесі — щодня, без хайпу