Google、Gemini 3.8 FlashおよびFlash-Liteのテキスト読み上げモデルを発表
Googleは2つの新しいテキスト読み上げモデル、Gemini 3.8 Flash TTSとGemini 3.8 Flash-Lite TTSをリリースし、クリエイター、開発者、企業向けに動的な音声生成機能を提供するGemini Audioファミリーを拡大しました。
Googleは2つの新しいテキスト読み上げモデル、Gemini 3.8 Flash TTSとGemini 3.8 Flash-Lite TTSをリリースし、クリエイター、開発者、企業向けに動的な音声生成機能を提供するGemini Audioファミリーを拡大しました。
xAIは、バージョン1.0の2倍の精度を持ちながら同じ価格を維持する音声からテキストへの変換モデルであるGrok Voice Transcribe 2.0をリリースしました。Grok Voiceの背後にあるオーディオ基盤モデルに基づいて構築され、不安定な電話回線や競合する音声など、困難な現実世界の条件に対応するために、ライブでノイズのある多言語オーディオの独自のデータセットを活用しています。
OpenAIはAPIでGPT-Live-1をリリースし、開発者が音声対応アプリケーションを構築できるよう、同時に聴取と発話を行う単一モデルを提供した。このリリースは、従来の連鎖型アーキテクチャを一元的なアプローチに置き換え、割り込みやコンテキストをより自然に処理することで、音声レイヤーの開発を簡素化することを目指している。
Googleは、その技術が70億人以上のユーザーに対して300以上の言語をサポートするようになったと報告し、音声理解の向上、過小代表言語のデータ収集、アクセシビリティを改善するための新ツールを導入しました。
Google は Gemini API と AI Studio を介して Gemini 3.8 Flash TTS および Flash-Lite TTS をリリースし、Hume の Voice Design Benchmark および Voice Arena で6言語でトップランクを達成しました。
Googleは、会話の流れを中断することなく推論しツールを実行するリアルタイム音声エージェント向けに設計されたネイティブな音声から音声へのモデルであるGemini 3.8 LiveおよびGemini 3.8 Live Extended Thinkingを発表した。
Open TTS Leaderboardは、Text-to-Speech (TTS) 評価における断片化と標準化の欠如に対処するため、遅くアリーナベースの人間による好みスコアに依存するのではなく、客観的な指標を使用してリリースされました。Qwen3 ASRおよびWavLM埋め込みを用いて、明瞭性、速度、話者類似性の各モデルを評価します。
アリババのQwenチームは、新しいQwen-Audio-3.1-Realtime-plusを含む5つのモデルからなるオーディオスタックであるQwen-Audio-3.1をリリースしました。これは、推論やツール使用が可能な音声エージェント向けに設計された全二重音声モデルです。また、本リリースではASRサービスの料金が最大95%引き下げられました。
llama.cpp プロジェクトはバージョン b11190 をリリースし、LFM2 オーディオ モデルで使用される mel プリプロセッサの修正を含んでいます。この変更は、英語の 4.5% と日本語の 6.5% のテスト発話で異なる貪欲なトランスクリプトを引き起こしていた不一致に対処します。
Googleは、そのGemini Audioファミリーの一環として、2つの新しいテキスト読み上げモデルであるGemini 3.8 Flash TTSとGemini 3.8 Flash-Lite TTSをリリースした。これらのモデルは、自然言語のプロンプトからの生成型音声デザインや、Gemini APIおよびGoogle AI Studioを通じた行ごとのパフォーマンス指示を導入している。
NVIDIAは、Hugging FaceでOpenMDWライセンス1.1の下で公開されているオープンウェイトの話者 diarization モデル「Nemotron 3 Diarization」をリリースしました。この1億パラメータのモデルは、単一のチェックポイントを使用して、リアルタイムまたはオフラインモードで最大8人の重なり合う話者を追跡します。
Googleは、2,000以上のボイスライブラリを備えた2つの新しいテキスト読み上げモデル、gemini-3.8-flash-ttsおよびgemini-3.8-flash-lite-ttsをリリースしました。
NVIDIAは、リアルタイムのスピーカーダイアライゼーションに対応するオープンウェイトの100MパラメータモデルであるNemotron 3 Diarizationをリリースしました。このモデルは最大8人の話者をサポートしています。
NemotronLabsは、聴取、文字起こし、推論、発話を統一されたストリーミングアーキテクチャ内で統合するために設計されたオープンウェイトのフルデュープレックス音声対話モデルであるVoiceChatを発表した。本システムは、ストリーミング音声エンコーダとデコーダのみからなる言語モデルを組み合わせ、エージェントテキストおよび構造化関数呼び出し用の並列専用出力ストリームに加え、逐次ユーザー文字起こし用の補助的なRNN-Tブランチを搭載している。
NemotronLabsは、統合ストリーミングアーキテクチャ内でネイティブのツール呼び出し機能を統合したオープンウェイトのフルデュプレックス音声対音声モデルであるNemotronLabs VoiceChatを発表しました。本システムは、ストリーミング音声エンコーダとデコーダのみからなる言語モデルを組み合わせ、エージェントテキストと構造化された関数呼び出し用の並列出力ストリームに加え、増分的な文字起こし用の補助RNN-TブランチおよびストリーミングTTSデコーダを備えています。
SpaceXAIは、ホストされたAPIを通じて提供される音声からテキストへの変換モデル「Grok Voice Transcribe 2.0」をリリースしました。このモデルは、同じ価格帯でバージョン1.0の約2倍の精度を実現すると主張しています。本モデルは、ノイズの多い電話回線や競合する音声といった困難な音声環境を対象としており、バッチ処理とリアルタイムストリーミングの両方のモードで動作します。
Googleは、OpenAIのGPT-Liveモデルと形状が類似している2つの新しいスピーチ・トゥ・スピーチ モデル、Gemini 3.8 LiveとGemini 3.8 Live Extended Thinkingをリリースしました。
あるAI開発者は、約500ms以下の初回トークンレイテンシを達成しつつ、コスト効率とスケーラビリティを維持するリアルタイム音声AIシステムを構築するためのアーキテクチャに関する助言を求めている。
Aidenは、複雑な視覚推論とデバイス操作を伴うフルデュプレックスの音声会話が必要で、両方を処理する単一モデルの制限を回避するエージェント向けのアーキテクチャを説明しています。この解決策は責任を分割します:リアルタイム音声モデルが会話を管理し、別個のより強力なモデルがバックグラウンドタスクを実行し、タスクキューを通じて非同期に調整します。
あるユーザーが、クラウドAPIを必要とせずにWindows上でCoqui XTTS-v2とQwen 2.5の完全なローカルデプロイメントを可能にするゼロ依存ラッパーであるF-0310をリリースしました。