トピック · Voice & audio
lab OpenAI News · 11日前 · 15 回表示

OpenAIエンジニアがターン検出器を排除するフルデュプレックス音声システム「GPT-Live」を開発

OpenAIは、従来のターン検出器を排除し、同時に聴取と発話ができるフルデュプレックスモデルを使用して、第三世代の音声システム「GPT-Live」をリリースした。このアーキテクチャにより、リアルタイムパフォーマンスに最適化された新しいシステム設計を通じて低レイテンシを維持しながら、より即座で自然な会話が可能になる。

lab xAI News · 16日前 · 28 回表示

xAIが音声推論と文字起こし精度を向上させたGrok Voice Think Fast 2.0をリリース

xAIは、知能、文字起こし精度、会話能力を強化するために設計された次世代の音声から音声への音声モデルであるGrok Voice Think Fast 2.0を発表した。このアップデートは、前作に基盤を置き、音声推論、会話能力、ツール使用の信頼性において意味のある向上をもたらす。

media The Batch · 28日前 GPQA Diamond · 84.2% · 4 回表示

OpenAIがフルデュプレックス音声モデルをリリース、ドイツの裁判所がGoogleにAIオーバビューの責任を課す

OpenAIは、再構築されたChatGPT Voiceを強化するためにGPT-Live-1とGPT-Live-1 miniを発表し、同時に聴取と発話ができるフルデュプレックス音声処理を導入した。このシステムは複雑なクエリをGPT-5.5などのバックグラウンド推論モデルに委譲し、深い思考が行われている間も継続的な会話を可能にする。

lab Hugging Face Blog · 4日前 · 8 回表示

NVIDIA Magpie TTSがアラビア語、韓国語、ポルトガル語を追加し品質を向上

NVIDIAはMagpie多言語TTSモデルのアップデートをリリースし、現代標準アラビア語、韓国語、ブラジルポルトガル語の追加により12言語へのサポートを拡大した。今回のリリースでは、更新されたトレーニングデータとアーキテクチャの変更を通じて既存言語の品質も改善されている。

media MarkTechPost · 5日前 · 12 回表示

NVIDIAが約450msのターンテイクを備えたオープンなフルデュプレックス音声対話モデル「NemotronLabs VoiceChat 11B」をリリース

NVIDIAは、リアルタイムのフルデュプレックス会話のために設計されたオープンな11Bパラメータのエンドツーエンド音声対話モデルであるNemotronLabs VoiceChat 11Bをリリースした。ASR、LLM、TTSをチェーンするカスケード型スタックとは異なり、この統合ネットワークはストリーミング音声の理解と生成を同時に実行し、Full-Duplex-Bench 1.0で測定されたスムーズなターンテイクレイテンシ448msを達成した。

github llama.cpp · 10日前 · 8 回表示

llama.cpp b10270 が Qwen3-TTS サポートを追加し、llama-tts に破壊的変更を導入

llama.cpp プロジェクトはバージョン b10270 をリリースし、Qwen3-TTS モデルのサポートを導入しました。このアップデートには llama-tts バイナリに対する破壊的変更が含まれ、新しいテキストから音声への変換ワークフローを処理するための重要なアーキテクチャ修正が実装されました。

media Hugging Face Forums · 12日前 · 8 回表示

OpenGauntletが168のTTSおよび106のSTTシステムのカタログを公開

研究者がOpenGauntlet研究カタログを公開しました。これは、168のテキスト読み上げ(TTS)システムと106の音声認識(STT)システムに関する情報を含む公開リソースです。ディレクトリには、オープンソースおよびホストモデル、ライセンス、ハードウェア要件、言語、機能、ライフサイクルステータス、ソース情報、利用可能な場合は公開されたベンチマークデータが含まれています。

media MarkTechPost · 25日前 · 2 回表示

アリババのTongyi LabがQwen-Audio-3.0-TTSをFlashとPlusの2つのティアでリリース

アリババのTongyi Labは、ホストされたテキスト読み上げシステムであるQwen-Audio-3.0-TTSをリリースしました。これはリアルタイム対話向けのFlashと高品質生成向けのPlusという2つのバリエーションで提供されます。両方のティアは、ダウンロード可能なモデルウェイトではなく、アリババクラウドのModel Studioを通じて配信されています。

media Hugging Face Forums · 29日前 · 1 回表示

NymphTech、AIラジオネットワーク向け最先端の音声クローニングを模索

NymphTechは、複数の言語と長時間放送を対象としたAIラジオ局ネットワークを強化するための、ハイエンドな音声クローニングおよび音声合成モデルの推奨を求めています。同社はすでにTrinityやMarkといった永続的なAIパーソナリティを搭載したプラットフォームを立ち上げており、Trinityは6月9日以来継続的に放送を行っています。