Googleは、会話の流れを中断することなく推論しツールを実行するリアルタイム音声エージェント向けに設計されたネイティブな音声から音声へのモデルであるGemini 3.8 LiveおよびGemini 3.8 Live Extended Thinkingを発表した。
- 両モデルは現在、ホスト型ソリューションとしてGemini Live APIとGoogle AI Studioで提供されている。
- Gemini 3.8 Liveはスケーラビリティとコスト効率に焦点を当てており、Extended Thinkingは多段階推論機能を追加している。
- Extended ThinkingはArtificial AnalysisのSpeech to Speech Quality Indexで82.6点を獲得し、1位となっている。
- これらのモデルは非同期関数呼び出し、視覚的コンテキスト、英数字精度、および97言語をサポートしている。
- Live API経由での料金体系は、音声入力に対して0.005ドル/分、音声出力に対して0.018ドル/分となっている。
これらのリリースにより、カスケード型音声パイプラインに代わる簡素化された代替手段が提供され、開発者は統合されたツール使用と低レイテンシを備えた本番グレードの音声エージェントを構築できるようになる。