Google представила нові голосові моделі Gemini 3.8 Live для розробників

Компанія Google анонсувала нові голосові моделі Gemini Live в рамках Gemini API та Google AI Studio, які призначені для розробки продуктів з голосовим управлінням у реальному часі.

Оновлення моделей

Включає Gemini 3.8 Live та Gemini 3.8 Live Extended Thinking, які можуть вести діалог і виконувати фонові завдання без переривання розмови. Модель Gemini 3.8 Live, розроблена за принципом «голос-до-голосу», інтегрує голосових агентів, здатних сприймати візуальний контекст та аналізувати складні дані.

Версія Extended Thinking обробляє багатокрокові запити у фоновому режимі, інформуючи користувача про хід виконання завдань.

Технічні характеристики

  • Підтримка понад 97 мов.
  • Асинхронні виклики API під час потокової передачі аудіо.
  • Вартість: $0,005 за хвилину аудіовходу та $0,018 за хвилину аудіовиходу.

Інтеграція доступна через партнерські платформи, такі як Vercel, LangChain, LiveKit, Agora, Fishjam, Pipecat та Vision Agents.

Інші можливості Google

Компанія також презентувала систему «мова-до-тексту» Gemini 3.5 Transcribe, яка підтримує понад 85 мов з низьким рівнем помилок: 4% для потокового та 2,6% для непотокового. Модель дозволяє налаштування термінологічного словника до 1000 слів.

Нагадаємо, що раніше Google випустила Gemini 3.8 Flash для програмування та автономних агентів, а також Gemini 3.8 Flash Cyber для аналізу коду та виявлення вразливостей.


Джерело: dev.ua (https://dev.ua/news/google-gemini-38-live-1789538151)