llama.cpp b10270 が Qwen3-TTS サポートを追加し、llama-tts に破壊的変更を導入
llama.cpp プロジェクトはバージョン b10270 をリリースし、Qwen3-TTS モデルのサポートを導入しました。このアップデートには llama-tts バイナリに対する破壊的変更が含まれ、新しいテキストから音声への変換ワークフローを処理するための重要なアーキテクチャ修正が実装されました。
llama.cpp プロジェクトはバージョン b10270 をリリースし、Qwen3-TTS モデルのサポートを導入しました。このアップデートには llama-tts バイナリに対する破壊的変更が含まれ、新しいテキストから音声への変換ワークフローを処理するための重要なアーキテクチャ修正が実装されました。
NVIDIAは、NemotronLabs-VoiceChat-11B音声チャットモデルをHugging Faceで利用可能にしました。リポジトリは全二重通信機能をサポートしていると説明されています。
OpenAIは、従来のターン検出器を排除し、同時に聴取と発話ができるフルデュプレックスモデルを使用して、第三世代の音声システム「GPT-Live」をリリースした。このアーキテクチャにより、リアルタイムパフォーマンスに最適化された新しいシステム設計を通じて低レイテンシを維持しながら、より即座で自然な会話が可能になる。
研究者がOpenGauntlet研究カタログを公開しました。これは、168のテキスト読み上げ(TTS)システムと106の音声認識(STT)システムに関する情報を含む公開リソースです。ディレクトリには、オープンソースおよびホストモデル、ライセンス、ハードウェア要件、言語、機能、ライフサイクルステータス、ソース情報、利用可能な場合は公開されたベンチマークデータが含まれています。
PolyAIは、トランスクリプトに依存するのではなく、発信者の生音声を直接処理する対話モデル「Dialog-RSN-1」を発表しました。これは、ターンテイキング、音声認識、関数呼び出し、応答生成を単一のオーディオ対応システムに融合しています。
xAIは、知能、文字起こし精度、会話能力を強化するために設計された次世代の音声から音声への音声モデルであるGrok Voice Think Fast 2.0を発表した。このアップデートは、前作に基盤を置き、音声推論、会話能力、ツール使用の信頼性において意味のある向上をもたらす。
Googleは、ユーザーがより豊かなトラックを創造的な制御下で作成できるよう支援するため、Google Flow Music内で最新の音楽生成モデルであるLyria 3.5をリリースしました。
アリババのTongyi Labは、ホストされたテキスト読み上げシステムであるQwen-Audio-3.0-TTSをリリースしました。これはリアルタイム対話向けのFlashと高品質生成向けのPlusという2つのバリエーションで提供されます。両方のティアは、ダウンロード可能なモデルウェイトではなく、アリババクラウドのModel Studioを通じて配信されています。
OpenAIは、再構築されたChatGPT Voiceを強化するためにGPT-Live-1とGPT-Live-1 miniを発表し、同時に聴取と発話ができるフルデュプレックス音声処理を導入した。このシステムは複雑なクエリをGPT-5.5などのバックグラウンド推論モデルに委譲し、深い思考が行われている間も継続的な会話を可能にする。
NymphTechは、複数の言語と長時間放送を対象としたAIラジオ局ネットワークを強化するための、ハイエンドな音声クローニングおよび音声合成モデルの推奨を求めています。同社はすでにTrinityやMarkといった永続的なAIパーソナリティを搭載したプラットフォームを立ち上げており、Trinityは6月9日以来継続的に放送を行っています。
研究者たちは、生成されたオーディオ内の対象イベントの存在と時間的関係を検証するために、オーディオ対応大規模言語モデル(ALLMs)を細粒度な審判として使用するフレームワークを提案する。このアプローチは、既存のテキストからオーディオへのモデルが複数の音響イベントとその順序に関する指示に従う際にしばしば失敗するというギャップに対処する。
ある研究は、音声評価のための自動判事として使用される大規模オーディオ言語モデル(LALM)のプロトコルレベルのショートカットを監査し、人間の評価との高い一致が、判断が実際の音声に基づいていることを保証しないことを明らかにした。この研究は6つの判事と4つの属性にわたって、3つのデプロイメントプロトコルを検査した:フィーチャーブループリント判定、参照条件付き判定、およびペアワイズA/B比較。
本研究は、教師なしWavLM表現に対して動的時間伸縮(DTW)を用い、ラベル付き学習データなしで英語および日本語の第二言語発話における音韻的正確性、リズム、イントネーションを評価する方法を検証している。学習者の発話をネイティブのテンプレートと比較する基本的なDTWアプローチは、包括的および文レベルの音韻スコアリングにおいて人間の合意を超えている。
オープンソースフレームワークのAudientは、LLMエージェントに対して継続的に音声を処理し、使用を通じて概念のメモリを構築するローカルの音声知覚レイヤーを提供します。これは、CLAP埋め込み、Whisper、Silero VAD、sqlite-vecを使用して、LLMへの呼び出しを常に必要とせずに音声イベントのゲート、指紋作成、認識を行います。
研究者は、自己回帰デコーダーを使用するのではなく、少数のノイズ除去ステップで全文書を並列に精製することで、離散拡散言語モデルが音声を文字起こしできることを実証しました。
Humeは、Real World VoiceEQを導入しました。これは、システムがトランスクリプトを超えて音響情報をどのように認識し生成するかを評価することで、音声インタラクションの人間品質を測定するために設計されたベンチマークです。このベンチマークは、785,000件のTTSおよび48,000件のSTSの人間評価から導出された60以上の指標を用いて、15以上の次元で40以上の独自およびオープンソースモデルを評価します。
audio.cppプロジェクトはバージョン0.3をリリースし、5つの新しいテキスト音声変換モデル(Supertonic 3、MOSS-TTS-Local、MOSS-TTS-Nano、IndexTTS2、Irodori-TTS)を導入しました。このアップデートではGGUFサポートも追加され、モデルごとに順次展開されます。
研究者らは、Whisperのような大規模事前学習ASRモデルを低資源言語でファインチューニングする際の壊滅的忘却を緩和するための手法であるUnified Gradient Projection (UGP)を提案した。UGPは統一射影空間内での言語バランスの取れたリプレイからの参照勾配を用いてパラメータ更新を制約し、言語ごとの寄与を効果的に均等化し、支配的な言語のバイアスを低減する。
著者は、AIエージェント向けに自前ホスト型・双方向の音声インタラクションを提供するオープンソースプロジェクト「Cicero」を紹介しています。一方通行のDictationツールとは異なり、Ciceroはエージェントが音声で応答し、Telegram経由でユーザーを呼び出すことができ、すべてのオーディオデータをローカルに保持します。
Hugging Faceフォーラムの開発者は、大規模な手書きシステムプロンプトに頼らず、Bland.ai、Retell、Vapiといった本番プラットフォームがプロンプトオーケストレーションをどのように管理しているかを理解しようとしています。著者は、FastAPI、Sarvam STT/TTS、Pipecat SmartTurn V3を使用した現在の実装について説明し、手動の状態ごとの注入が複雑さの増大とエッジケースでの失敗につながると指摘しています。