OpenAIエンジニアがターン検出器を排除するフルデュプレックス音声システム「GPT-Live」を開発
OpenAIは、従来のターン検出器を排除し、同時に聴取と発話ができるフルデュプレックスモデルを使用して、第三世代の音声システム「GPT-Live」をリリースした。このアーキテクチャにより、リアルタイムパフォーマンスに最適化された新しいシステム設計を通じて低レイテンシを維持しながら、より即座で自然な会話が可能になる。
OpenAIは、従来のターン検出器を排除し、同時に聴取と発話ができるフルデュプレックスモデルを使用して、第三世代の音声システム「GPT-Live」をリリースした。このアーキテクチャにより、リアルタイムパフォーマンスに最適化された新しいシステム設計を通じて低レイテンシを維持しながら、より即座で自然な会話が可能になる。
xAIは、知能、文字起こし精度、会話能力を強化するために設計された次世代の音声から音声への音声モデルであるGrok Voice Think Fast 2.0を発表した。このアップデートは、前作に基盤を置き、音声推論、会話能力、ツール使用の信頼性において意味のある向上をもたらす。
Googleは、ユーザーがより豊かなトラックを創造的な制御下で作成できるよう支援するため、Google Flow Music内で最新の音楽生成モデルであるLyria 3.5をリリースしました。
OpenAIは、再構築されたChatGPT Voiceを強化するためにGPT-Live-1とGPT-Live-1 miniを発表し、同時に聴取と発話ができるフルデュプレックス音声処理を導入した。このシステムは複雑なクエリをGPT-5.5などのバックグラウンド推論モデルに委譲し、深い思考が行われている間も継続的な会話を可能にする。
llama.cppプロジェクトはビルドb10369をリリースし、pocket-tts テキスト読み上げモデルのサポートを導入しました。このアップデートには、パフォーマンスを最適化するためにGEMMとcol2imを使用した転置畳み込みの新しい実装が含まれています。
NVIDIAはMagpie多言語TTSモデルのアップデートをリリースし、現代標準アラビア語、韓国語、ブラジルポルトガル語の追加により12言語へのサポートを拡大した。今回のリリースでは、更新されたトレーニングデータとアーキテクチャの変更を通じて既存言語の品質も改善されている。
NVIDIAは、リアルタイムのフルデュプレックス会話のために設計されたオープンな11Bパラメータのエンドツーエンド音声対話モデルであるNemotronLabs VoiceChat 11Bをリリースした。ASR、LLM、TTSをチェーンするカスケード型スタックとは異なり、この統合ネットワークはストリーミング音声の理解と生成を同時に実行し、Full-Duplex-Bench 1.0で測定されたスムーズなターンテイクレイテンシ448msを達成した。
llama.cpp プロジェクトはバージョン b10270 をリリースし、Qwen3-TTS モデルのサポートを導入しました。このアップデートには llama-tts バイナリに対する破壊的変更が含まれ、新しいテキストから音声への変換ワークフローを処理するための重要なアーキテクチャ修正が実装されました。
NVIDIAは、NemotronLabs-VoiceChat-11B音声チャットモデルをHugging Faceで利用可能にしました。リポジトリは全二重通信機能をサポートしていると説明されています。
研究者がOpenGauntlet研究カタログを公開しました。これは、168のテキスト読み上げ(TTS)システムと106の音声認識(STT)システムに関する情報を含む公開リソースです。ディレクトリには、オープンソースおよびホストモデル、ライセンス、ハードウェア要件、言語、機能、ライフサイクルステータス、ソース情報、利用可能な場合は公開されたベンチマークデータが含まれています。
PolyAIは、トランスクリプトに依存するのではなく、発信者の生音声を直接処理する対話モデル「Dialog-RSN-1」を発表しました。これは、ターンテイキング、音声認識、関数呼び出し、応答生成を単一のオーディオ対応システムに融合しています。
アリババのTongyi Labは、ホストされたテキスト読み上げシステムであるQwen-Audio-3.0-TTSをリリースしました。これはリアルタイム対話向けのFlashと高品質生成向けのPlusという2つのバリエーションで提供されます。両方のティアは、ダウンロード可能なモデルウェイトではなく、アリババクラウドのModel Studioを通じて配信されています。
NymphTechは、複数の言語と長時間放送を対象としたAIラジオ局ネットワークを強化するための、ハイエンドな音声クローニングおよび音声合成モデルの推奨を求めています。同社はすでにTrinityやMarkといった永続的なAIパーソナリティを搭載したプラットフォームを立ち上げており、Trinityは6月9日以来継続的に放送を行っています。