Qwen3.8-Max претендує на бізнес-рівень
Qwen3.8-Max порівняли з Claude Opus 5, Kimi K3 і GPT-5.6 Sol у простому візуальному тесті: моделям дали фото неба й попросили намалювати силует тварини за формою хмар. У цьому неформальному завданні Qwen виглядав не гірше за конкурентів, тоді як GPT інтерпретував зображення інакше.
Важливіше, що за даними Alibaba, Qwen3.8-Max — це мультимодальна MoE-модель на 2,4 трлн параметрів. Компанія заявляє результат 86,1 на OSWorld-Verified проти 83,2 у GPT-5.6 Sol Max і 85,0 у Fable 5.
Що це означає для бізнесу: китайські моделі вже варто включати в порівняльне тестування, особливо для задач із документами, візуальними матеріалами й агентною роботою.
На що дивитися в Qwen3.8-Max, крім тесту з хмарами
Візуальний приклад із силуетом тварини показує лише одну грань моделі: вона може працювати із зображенням і давати інтерпретацію. У першоджерелі акцент інший: Alibaba позиціонує Qwen3.8-Max як модель для агентної роботи, де система не просто відповідає на запит, а веде довгий процес із плануванням, перевірками й повторними правками.
У матеріалі Qwen3.8-Max описано як мультимодальну MoE-модель на 2,4 трлн параметрів. Компанія заявляє сильні результати на OSWorld-Verified, PaperBench, TerminalBench 2.1, Vision2Web, LVBench і ERQA. Це різні типи перевірок: робота з комп'ютерним середовищем, відтворення досліджень, термінальні задачі, візуальні вебінтерфейси, довгі відео та пошук відповідей у складних матеріалах.
Для бізнесу це означає, що модель варто оцінювати не лише за якістю тексту. Окремо треба тестувати, чи може вона пройти весь робочий ланцюжок: прочитати матеріали, скласти план, виконати кроки, побачити помилку, виправити її й пояснити, що саме змінилося.
Три робочі ситуації для тестування
Перша ситуація: агентна робота з робочим столом. OSWorld-Verified перевіряє агентів, які взаємодіють із desktop-середовищами. Для офісної команди це ближче до реальної роботи, ніж тест на знання: модель має орієнтуватися в інтерфейсі, виконувати послідовність дій і не втрачати контекст.
Друга ситуація: відтворення складного матеріалу з кодом. У першоджерелі сказано, що Alibaba показує здатність Qwen3.8-Max відтворювати дослідницькі роботи з тисячами рядків коду. Для нетехнічного бізнесу тут корисний сам принцип: модель треба перевіряти на задачах, де є багато інструкцій, залежностей і проміжних результатів, а не на одному короткому запиті.
Третя ситуація: візуальна робота з вебом. Vision2Web оцінює візуальну веброзробку. Навіть якщо компанія не пише код власними силами, це корисний сценарій для перевірки: дати моделі макет, сторінку або візуальний приклад і подивитися, чи вона правильно переносить структуру, логіку екрана й зворотний зв'язок у наступні правки.
Перевір інтерфейс на зображенні, опиши послідовність дій користувача і вкажи місця, де сценарій може зірватися.Прочитай опис задачі, склади план виконання, після кожного кроку запиши очікуваний результат і критерій перевірки.Порівняй візуальний приклад із отриманим результатом і назви конкретні розбіжності без загальних оцінок.
Як проводити внутрішнє порівняння моделей
Починати варто з однакових завдань для кількох моделей. У першоджерелі Qwen3.8-Max порівнюється з GPT-5.6 Sol Max, Fable 5, Gemini 3.1 Pro та іншими моделями на окремих бенчмарках. Але для компанії зовнішній рейтинг не замінює власної перевірки: модель може бути сильною в агентній роботі й слабшою в іншій категорії.
Порівняння має бути не про те, яка модель звучить переконливіше. Треба дивитися, чи вона закінчує задачу, чи вміє переглядати план, чи коректно працює з візуальним або довгим контекстом, чи не приховує невизначеність. У матеріалі прямо вказано, що частина демонстрацій Qwen3.8-Max поки вироблена самою компанією і ще не була широко відтворена незалежними оцінювачами.
- Дайте всім моделям один і той самий набір файлів, зображень або інструкцій.
- Забороніть загальні відповіді: вимагайте кроки, проміжні висновки й ознаки завершення.
- Перевіряйте не лише фінальний текст, а й те, чи модель виправляє власний план після зворотного зв'язку.
- Фіксуйте категорії, де модель відстає: у першоджерелі сказано, що Qwen3.8-Max лідирує не всюди.
Межі застосування і перевірка перед довірою
Головне обмеження: заявлені результати ще мають пройти ширше незалежне тестування. Якщо компанія переносить модель у бізнес-процес, не можна спиратися лише на таблицю з бенчмарками або демонстрацію від постачальника. Особливо це стосується задач, які тривають довго й мають багато проміжних рішень.
Друге обмеження пов'язане з відкритими вагами. Alibaba заявляє, що Qwen3.8-Max і Qwen3.8-27B мають вийти з open weights наступного тижня. Але ліцензійні умови ще не розкриті. У першоджерелі прямо зазначено: це може бути не широка permissive-ліцензія, а більш обмежувальна кастомна модель, як у випадку з Kimi K3.
Перед використанням у робочому процесі людина має перевірити три речі: чи дозволяє ліцензія потрібний сценарій, чи модель справді виконує задачу на ваших матеріалах, і чи є ручна перевірка результату перед дією. Для агентних систем це критично: помилка може виникнути не в одній відповіді, а на третьому або десятому кроці виконання.
- Не довіряйте результату без незалежної перевірки або власного тесту на реальному сценарії.
- Не оцінюйте модель тільки за короткою відповіддю: перевіряйте весь ланцюжок роботи.
- Не плануйте self-hosted deployment, доки не відомі ліцензійні умови.
- Не змішуйте результати різних бенчмарків: OSWorld-Verified, PaperBench і Vision2Web вимірюють різні здібності.