Google представила Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking, нативные модели преобразования речи в речь, предназначенные для голосовых агентов реального времени, которые рассуждают и выполняют инструменты без прерывания разговорного потока.

  • Обе модели теперь доступны в Gemini Live API и Google AI Studio как размещенные решения.
  • Gemini 3.8 Live делает акцент на масштабируемости и эффективности затрат, тогда как Extended Thinking добавляет возможности многошагового рассуждения.
  • Extended Thinking занимает #1 место в индексе качества преобразования речи в речь от Artificial Analysis с оценкой 82.6.
  • Модели поддерживают асинхронный вызов функций, визуальный контекст, точность алфанумерических данных и 97 языков.
  • Стоимость составляет $0.005/мин за входной аудиофайл и $0.018/мин за выходной аудиофайл через Live API.

Эти релизы обеспечивают упрощенную альтернативу каскадным речевым конвейерам, позволяя разработчикам создавать голосовых агентов производственного уровня с интегрированным использованием инструментов и низкой задержкой.