Grok 4.7 дешевший за Fable 5.1, але не завжди
21 вересня xAI випустив Grok 4.7 за ціною 4.6: $2 за 1 млн вхідних токенів, вп'ятеро дешевше за вхідну ціну Fable 5.1 ($10). За таблицею xAI Grok виграє в EEBench (64,0% проти 56,4%), але програє в Terminal-Bench 4.0 (37,6% проти 57,9%) і CursorBench 4.0 (46,3% проти 51,8%).
Різниця цін не дорівнює різниці вартості задачі: на тесті з 50 000 вхідних і 10 000 вихідних токенів Grok коштує $0,16, Fable — $1,00, тобто вшестеро менше, не вп'ятеро. The Decoder за даними Artificial Analysis наводить інший результат Terminal-Bench — 26% замість заявлених 37,6%.
Де Grok виграє переконливо, а де сильно відстає
У повній таблиці xAI різниця не обмежується трьома тестами з поста. У бенчмарку для юридичних агентів Grok 4.7 набрав 19,6% проти 6,7% у Fable 5.1 — тут розрив на користь Grok найбільший з усіх наведених показників. А в HealthBench Professional, тесті на клінічні міркування, Grok поступився одразу двом конкурентам — і Fable 5.1, і GPT-5.6 Sol.
Ціна Grok 4.7 залишилась такою ж, як у Grok 4.6: $2 за 1 млн вхідних токенів і $6 за вихідні. Для порівняння GPT-5.6 Sol коштує $4 за вхід і $20 за вихід.
Чому дешевший токен не означає дешевшу задачу
За вимірюваннями Artificial Analysis, Grok 4.7 у режимі xhigh під час комплексного індексного тесту згенерував 240 млн токенів — помітно більше за медіанні 92 млн у моделей того ж ціннісного діапазону. Якщо модель «балакучіша», низька ціна за токен не гарантує низького рахунку за задачу.
- Якщо один запит перевищує 200 000 токенів, ціна зростає до $4 за вхід і $12 за вихід — і за новим тарифом рахується весь запит цілком;
- це змінює економіку саме для сценаріїв з читанням довгих документів;
- за даними того ж звіту Artificial Analysis, комплексний Intelligence Index у Grok 4.7 становить 46, тоді як у Fable 5.1 і GPT-6 — по 53; значення для Grok автор підтвердив безпосередньо на сторінці Artificial Analysis, а цифру 53 для конкурентів — лише за переказом звіту, без доступу до первинних даних.
Хто ставить лінійку: Cursor тепер у структурі xAI
CursorBench, на якому побудована офіційна порівняльна таблиця xAI, походить від компанії Cursor. Ту придбала SpaceX за угодою на $60 млрд повністю акціями, анонсованою в червні й завершеною в середині серпня. Оскільки сама xAI теж входить у структуру SpaceX із лютого, обидві компанії тепер в одній групі; Cursor, за наявними даними, уже надавала інсайти та дані для навчання Grok 4.5 і 4.6.
Це не доказ підтасовки: лідером CursorBench залишається Fable 5.1, а Grok 4.7 до нього не дотягує. Але після того, як розробка критерію оцінки й продаж продукту опинились під одним дахом, вага незалежних, стороннопроведених вимірювань зростає.
Де це реально застосовувати
Grok 4.7 доступний у Cursor і Grok Build, через API, а також поступово в сторонніх інструментах розробки, хмарах і застосунку Grok. Grok Build можна протестувати безкоштовно. За заявою xAI, з версії 4.6 покращилась якість створення документів і презентацій — саме багатогодинні дослідницькі й контентні задачі офіційно названі цільовим сценарієм використання цієї моделі.
Для рішень, пов'язаних із медициною чи здоров'ям, інші моделі показують кращий результат навіть за власною таблицею xAI, тож вибирати Grok під такі задачі лише через ціну не варто. Заяви xAI про найкращий у галузі рівень відмов і стійкості до джейлбрейків спираються на внутрішнє тестування компанії, незалежного підтвердження немає. За наявною інформацією, Grok 4.8 вже в розробці, а Grok 4.9 орієнтований на рівень Fable і GPT-6 Astra — тобто поточна версія розглядається як проміжний крок, а не фінальна точка.