Google запустив нові голосові моделі Gemini Live
Gemini 3.8 Live Extended Thinking очолила Speech to Speech Quality Index від Artificial Analysis (82.6 бала) і набрала 97.7% на Big Bench Audio. Gemini 3.8 Live зайняла 2-е місце в Speech Agent Arena. Обидві перемикають 97 мов у розмові й виконують інструменти у фоні, не перериваючи діалог.
Моделі вже тестують Salesforce, Genspark і Lumeris; платформи LiveKit, Pipecat і Vercel вбудовують їх через Gemini Live API. Аудіо маркується SynthID.
Що це означає для бізнесу: розробникам обидві моделі вже доступні в Gemini API та AI Studio. Підписникам Google AI Pro і Ultra Extended Thinking працює в Gemini Live і Docs, а в Gmail і Keep — усім підписникам Google AI. Enterprise-версія ще в приватному перегляді.
Дві моделі під різні задачі
Gemini 3.8 Live створена для масштабу й економічності: вона поєднує розмовний інтелект із плавним діалогом і візуальним контекстом — модель обробляє відео чи зображення з камери майже в реальному часі й додає це до розмови. Gemini 3.8 Live Extended Thinking розрахована на складніші задачі з багатоетаповим міркуванням і вищим рівнем інтелекту, тому й поводиться інакше: вона міркує та говорить одночасно, використовуючи фрази на кшталт «Зараз перевірю…», щоб природно підтвердити запит, а потім вголос розповідає про прогрес виконання багатокрокових фонових задач.
Наскільки добре модель виконує задачі
Крім загальних тестів якості мовлення, Google наводить окремі агентські показники: Extended Thinking виконала 68,6% задач у бенчмарку τ-Voice і 35,1% — у банківському τ-Voice-banking від Sierra. Це тести не на якість звуку, а на те, чи доводить голосовий агент реальну задачу до кінця. Заміри проводили на Live API в межах Gemini Enterprise Agent Platform.
Хто вже будує на цьому
Крім Salesforce, Genspark і Lumeris, до Gemini Live API вже підключаються платформи Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel і Vision Agents. Вони беруть на себе інфраструктуру потокової передачі медіа в реальному часі, тож розробникам залишається працювати над самим інтерфейсом голосового агента, а не над транспортним рівнем.
Умови доступу по чергах
Обидві моделі розгортаються поетапно і по-різному для кожної аудиторії. Для 3.8 Live:
- розробники — Gemini API та Google AI Studio;
- enterprise — приватний перегляд у Gemini Enterprise, незабаром у Gemini Enterprise for Customer Experience;
- усі користувачі — у Search Live.
Для 3.8 Live Extended Thinking:
- розробники — Gemini API та Google AI Studio;
- enterprise — приватний перегляд у Gemini Enterprise, незабаром у Gemini Enterprise for Customer Experience та для бізнес-клієнтів Google Workspace;
- усі користувачі — у Gemini Live, а також у Docs для підписників Google AI Pro та Ultra й у Gmail і Keep для всіх підписників Google AI.
Ціни в матеріалі не наведено.