AI Фактор

Google запустив нові голосові моделі Gemini Live

Новина 16.09.2026
Google запустив нові голосові моделі Gemini Live

Gemini 3.8 Live Extended Thinking очолила Speech to Speech Quality Index від Artificial Analysis (82.6 бала) і набрала 97.7% на Big Bench Audio. Gemini 3.8 Live зайняла 2-е місце в Speech Agent Arena. Обидві перемикають 97 мов у розмові й виконують інструменти у фоні, не перериваючи діалог.

Моделі вже тестують Salesforce, Genspark і Lumeris; платформи LiveKit, Pipecat і Vercel вбудовують їх через Gemini Live API. Аудіо маркується SynthID.

Що це означає для бізнесу: розробникам обидві моделі вже доступні в Gemini API та AI Studio. Підписникам Google AI Pro і Ultra Extended Thinking працює в Gemini Live і Docs, а в Gmail і Keep — усім підписникам Google AI. Enterprise-версія ще в приватному перегляді.

Дві моделі під різні задачі

Gemini 3.8 Live створена для масштабу й економічності: вона поєднує розмовний інтелект із плавним діалогом і візуальним контекстом — модель обробляє відео чи зображення з камери майже в реальному часі й додає це до розмови. Gemini 3.8 Live Extended Thinking розрахована на складніші задачі з багатоетаповим міркуванням і вищим рівнем інтелекту, тому й поводиться інакше: вона міркує та говорить одночасно, використовуючи фрази на кшталт «Зараз перевірю…», щоб природно підтвердити запит, а потім вголос розповідає про прогрес виконання багатокрокових фонових задач.

Наскільки добре модель виконує задачі

Крім загальних тестів якості мовлення, Google наводить окремі агентські показники: Extended Thinking виконала 68,6% задач у бенчмарку τ-Voice і 35,1% — у банківському τ-Voice-banking від Sierra. Це тести не на якість звуку, а на те, чи доводить голосовий агент реальну задачу до кінця. Заміри проводили на Live API в межах Gemini Enterprise Agent Platform.

Хто вже будує на цьому

Крім Salesforce, Genspark і Lumeris, до Gemini Live API вже підключаються платформи Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel і Vision Agents. Вони беруть на себе інфраструктуру потокової передачі медіа в реальному часі, тож розробникам залишається працювати над самим інтерфейсом голосового агента, а не над транспортним рівнем.

Умови доступу по чергах

Обидві моделі розгортаються поетапно і по-різному для кожної аудиторії. Для 3.8 Live:

  • розробники — Gemini API та Google AI Studio;
  • enterprise — приватний перегляд у Gemini Enterprise, незабаром у Gemini Enterprise for Customer Experience;
  • усі користувачі — у Search Live.

Для 3.8 Live Extended Thinking:

  • розробники — Gemini API та Google AI Studio;
  • enterprise — приватний перегляд у Gemini Enterprise, незабаром у Gemini Enterprise for Customer Experience та для бізнес-клієнтів Google Workspace;
  • усі користувачі — у Gemini Live, а також у Docs для підписників Google AI Pro та Ultra й у Gmail і Keep для всіх підписників Google AI.

Ціни в матеріалі не наведено.

Читати в ТелеграміПрактика ШІ в бізнесі — щодня, без хайпу