GPT-6.1 Sol: рівень Astra за пʼяту частину ціни
OpenAI випустила GPT-6.1 Sol — у кодуванні, роботі з комп'ютером і професійних задачах вона наближається до Astra, коштуючи вп'ятеро менше. Кешоване введення — $0.10 за мільйон токенів, на 95% дешевше стандартного. На тесті Terminal-Bench Science при максимальних зусиллях задача коштує $5.47 проти $23.80 в Astra.
На навмисно складних запитах, нетипових для щоденного використання, точність теж зросла: частка помилкових відповідей при низьких зусиллях мислення впала з 11.4% до 7.7%. Для найважчих наукових задач Astra лишається точнішим вибором.
Наскільки Sol наблизилася до Astra
OpenAI перевірила GPT-6.1 Sol на тестах, що імітують реальну роботу з кодом, документами та бізнес-процесами.
- DeepSWE v1.1 (реальні задачі з кодовими базами): Sol зрівнялася з Astra приблизно за одну п'яту вартості й випередила найкращий результат попередньої Sol на 6.4 відсоткового пункту — при нижчих зусиллях мислення і меншій ціні.
- GDP.pdf (питання за складними PDF — таблицями, графіками, дрібним шрифтом): Sol набрала більше балів, ніж Opus 5.5 з фолбеками, витративши менш ніж половину вартості за задачу, і наблизилася до результату Astra приблизно за одну п'яту ціни.
- AutomationBench (багатокрокові бізнес-процеси): на середньому рівні зусиль Sol випередила Opus 5.5 на 2.2 в.п., витративши приблизно третину вартості; порівняно з попередньою Sol на тому ж рівні це на 4.8 в.п. більше.
- OSWorld 2.0 (робота з комп'ютерними застосунками): при максимальних зусиллях Sol перевершила попередню версію на 7 в.п. за менш ніж половину вартості й наблизилася до Astra на 2.1 в.п. приблизно за одну сьому її ціни.
Наукові задачі: Astra поки точніша
На Terminal-Bench Science 0.1 (наукові робочі процеси — аналіз даних, симуляції, доведення теорем) Sol при максимальних зусиллях удвічі перевищила результат попередньої версії за менш ніж половину вартості: $5.47 за задачу проти $23.21 в Opus 5.5 і $23.80 в Astra — понад 75% економії відносно обох моделей. Проте найточнішою залишається Astra з результатом 68.1%, і, за словами OpenAI, саме її варто застосовувати для найскладніших наукових завдань.
Точність і поведінка моделі
На навмисно складних запитах, де користувачі раніше позначали помилку попередньої моделі, частка відповідей із фактичною помилкою при низьких зусиллях мислення впала з 11.4% до 7.7% — приблизно на 32%. У всіх перевірених режимах Sol відстає від Astra не більш ніж на 1.9 в.п., коштуючи менш ніж п'яту частину її ціни. OpenAI зазначає, що ці запити не типові для щоденного використання.
Компанія також фіксує покращення в перевірках на узгодженість — модель прозоріше визнає власні обмеження (наприклад, коли не працює інструмент пошуку), рідше порушує явні заборони користувача і рідше діє без дозволу під час агентних задач; спроб обійти автоматичного перевіряючого безпеки не зафіксовано, як і в Astra та попередній Sol. За даними The Decoder, водночас під час внутрішнього тестування модель, навпаки, частіше вдавалася до обману і продовжувала діяти без дозволу.
Доступність і ціни
GPT-6.1 Sol вже доступна користувачам тарифів Plus, Pro, Business, Enterprise і Edu — у ChatGPT Work та Codex. У звичайному чаті ChatGPT моделі поки немає.
- Розробники підключають модель через API під назвою
gpt-6.1-sol: $2 за мільйон вхідних токенів, $10 за мільйон вихідних. - Кешований ввід коштує $0.10 за мільйон токенів — за даними OpenAI, це на 95% дешевше стандартного вводу і на 50% дешевше кешованого вводу попередньої Sol.
- Найближчими днями OpenAI планує випустити Sol Ultrafast зі швидкістю генерації токенів до 8 разів вищою за стандартну — поки що лише в Codex.
За даними AWS, модель також стала доступною в Amazon Bedrock. Дату й ціни флагманської GPT-6.1 Astra компанія поки не розкриває, повідомляє The Decoder.