xAI вдвоє підвищив точність розпізнавання мовлення
18 вересня xAI випустила Grok Voice Transcribe 2.0, вдвічі точнішу за версію 1.0. На коротких голосових командах 19 мовами частка помилок впала з 20,6% до 6,8%. Atlassian вже транскрибує нею всі відео в Loom.
Модель базується на Grok Voice, яка вже обробляє десятки тисяч дзвінків підтримки щодня і працює в голосовому асистенті Tesla. Ціна незмінна: $0,10 за годину пакетно, $0,20 у стрімінгу.
Де ще працює ця модель
Grok Voice Transcribe 2.0 побудована на тій самій аудіо-платформі, що й голосовий асистент Grok Voice. За даними xAI, Grok Voice вже обробляє десятки тисяч дзвінків підтримки на день, транскрибує мільйони годин відео-озвучки і працює у голосових агентах фізичних продуктів — зокрема в асистенті Grok у автомобілях Tesla. Нову модель тренували на «живому», зашумленому багатомовному аудіо з різних середовищ і додатково доналаштовували.
Як виміряна точність
xAI заявляє перше місце за точністю серед 32 стрімінгових моделей у публічному рейтингу Artificial Analysis. Окрім цього, компанія рахує частку помилок на чотирьох власних наборах з реального трафіку: телефонні дзвінки підтримки, розмови з Grok, вимовлені облікові дані (коди рахунків, email) і короткі багатомовні голосові команди. За всіма чотирма наборами нова модель обійшла версію 1.0, а на телефонному наборі (8 кГц, англійська) — випередила всіх конкурентів, з якими її порівнювали: Gemini 3.5 Transcribe, MAI-Transcribe-2, ElevenLabs Scribe v2, Deepgram Nova-3 і Whisper Large v3.
Найбільший приріст точності — саме на багатомовних коротких фразах: модель розпізнає мову автоматично і встигає підхопити перемикання мови всередині одного запису. xAI пояснює це так: короткі команди (наприклад, голосові в авто) залишають моделі мало контексту для визначення мови, тому саме там стара версія помилялася найчастіше.
Що є в API
Speech-to-Text API підтримує як пакетну обробку файлів і посилань, так і стрімінг у реальному часі. У наборі функцій — часові мітки слів із рівнем упевненості, розділення мовців (без додаткової плати), обробка до восьми аудіоканалів одночасно, налаштування до 100 галузевих термінів на запит для точнішого розпізнавання, форматування чисел, дат, валют, телефонів і email у письмовому вигляді, видалення слів-філерів («е-е», «типу») та визначення кінця репліки для голосових агентів.
- 12 підтримуваних аудіоформатів, максимальний розмір файлу — 500 МБ
- Частоти дискретизації: 8000, 16000, 22050, 24000, 44100, 48000 Гц
- Письмове форматування — для 25 мов, включно з англійською, іспанською, французькою, німецькою, гінді, японською та корейською
- Стрімінг — через WebSocket, з проміжними результатами приблизно раз на 500 мс
Перехід на нову версію
xAI навела приклад Atlassian: команда порівняла нову модель з чинним рішенням для транскрибування, визнала її точнішою і тепер прогонює через неї всі відео в Loom. За словами Санчана Саксени, старшого віцепрезидента Teamwork Collection в Atlassian, транскрипти з Loom далі йдуть у Cursor для генерації коду — так компанія замикає ланцюжок від запису наміру до готового коду.
Grok Voice Transcribe 2.0 незабаром стане моделлю за замовчуванням у Speech-to-Text API, а версію 1.0 виведуть з експлуатації в найближчі тижні; ті, хто хоче лишитися на старій моделі на час переходу, можуть явно вказати grok-voice-transcribe-1.0 у запиті. Наразі за замовчуванням (якщо параметр моделі не вказано) документація все ще повертає версію 1.0.