Voice & audio
github llama.cpp · 5日前 · 5 回表示

llama.cpp b10270 が Qwen3-TTS サポートを追加し、llama-tts に破壊的変更を導入

llama.cpp プロジェクトはバージョン b10270 をリリースし、Qwen3-TTS モデルのサポートを導入しました。このアップデートには llama-tts バイナリに対する破壊的変更が含まれ、新しいテキストから音声への変換ワークフローを処理するための重要なアーキテクチャ修正が実装されました。

lab OpenAI News · 5日前 · 8 回表示

OpenAIエンジニアがターン検出器を排除するフルデュプレックス音声システム「GPT-Live」を開発

OpenAIは、従来のターン検出器を排除し、同時に聴取と発話ができるフルデュプレックスモデルを使用して、第三世代の音声システム「GPT-Live」をリリースした。このアーキテクチャにより、リアルタイムパフォーマンスに最適化された新しいシステム設計を通じて低レイテンシを維持しながら、より即座で自然な会話が可能になる。

media Hugging Face Forums · 6日前

OpenGauntletが168のTTSおよび106のSTTシステムのカタログを公開

研究者がOpenGauntlet研究カタログを公開しました。これは、168のテキスト読み上げ(TTS)システムと106の音声認識(STT)システムに関する情報を含む公開リソースです。ディレクトリには、オープンソースおよびホストモデル、ライセンス、ハードウェア要件、言語、機能、ライフサイクルステータス、ソース情報、利用可能な場合は公開されたベンチマークデータが含まれています。

lab xAI News · 11日前 · 10 回表示

xAIが音声推論と文字起こし精度を向上させたGrok Voice Think Fast 2.0をリリース

xAIは、知能、文字起こし精度、会話能力を強化するために設計された次世代の音声から音声への音声モデルであるGrok Voice Think Fast 2.0を発表した。このアップデートは、前作に基盤を置き、音声推論、会話能力、ツール使用の信頼性において意味のある向上をもたらす。

media MarkTechPost · 19日前 · 1 回表示

アリババのTongyi LabがQwen-Audio-3.0-TTSをFlashとPlusの2つのティアでリリース

アリババのTongyi Labは、ホストされたテキスト読み上げシステムであるQwen-Audio-3.0-TTSをリリースしました。これはリアルタイム対話向けのFlashと高品質生成向けのPlusという2つのバリエーションで提供されます。両方のティアは、ダウンロード可能なモデルウェイトではなく、アリババクラウドのModel Studioを通じて配信されています。

media The Batch · 23日前 GPQA Diamond · 84.2% · 3 回表示

OpenAIがフルデュプレックス音声モデルをリリース、ドイツの裁判所がGoogleにAIオーバビューの責任を課す

OpenAIは、再構築されたChatGPT Voiceを強化するためにGPT-Live-1とGPT-Live-1 miniを発表し、同時に聴取と発話ができるフルデュプレックス音声処理を導入した。このシステムは複雑なクエリをGPT-5.5などのバックグラウンド推論モデルに委譲し、深い思考が行われている間も継続的な会話を可能にする。

media Hugging Face Forums · 23日前

NymphTech、AIラジオネットワーク向け最先端の音声クローニングを模索

NymphTechは、複数の言語と長時間放送を対象としたAIラジオ局ネットワークを強化するための、ハイエンドな音声クローニングおよび音声合成モデルの推奨を求めています。同社はすでにTrinityやMarkといった永続的なAIパーソナリティを搭載したプラットフォームを立ち上げており、Trinityは6月9日以来継続的に放送を行っています。

arxiv arXiv cs.CL · 24日前

オーディオ対応大規模言語モデルからの細粒度フィードバックによるテキストからオーディオへの指示追従の改善

研究者たちは、生成されたオーディオ内の対象イベントの存在と時間的関係を検証するために、オーディオ対応大規模言語モデル(ALLMs)を細粒度な審判として使用するフレームワークを提案する。このアプローチは、既存のテキストからオーディオへのモデルが複数の音響イベントとその順序に関する指示に従う際にしばしば失敗するというギャップに対処する。

arxiv arXiv cs.CL · 24日前

音声評価における大規模オーディオ言語モデル判事のプロトコルレベルのショートカット監査

ある研究は、音声評価のための自動判事として使用される大規模オーディオ言語モデル(LALM)のプロトコルレベルのショートカットを監査し、人間の評価との高い一致が、判断が実際の音声に基づいていることを保証しないことを明らかにした。この研究は6つの判事と4つの属性にわたって、3つのデプロイメントプロトコルを検査した:フィーチャーブループリント判定、参照条件付き判定、およびペアワイズA/B比較。

arxiv arXiv cs.CL · 24日前

WavLMに対するDTWにより、音韻論、リズム、イントネーションのテキスト不要な第二言語発話評価が可能に

本研究は、教師なしWavLM表現に対して動的時間伸縮(DTW)を用い、ラベル付き学習データなしで英語および日本語の第二言語発話における音韻的正確性、リズム、イントネーションを評価する方法を検証している。学習者の発話をネイティブのテンプレートと比較する基本的なDTWアプローチは、包括的および文レベルの音韻スコアリングにおいて人間の合意を超えている。

media r/LocalLLaMA · 25日前

AudientがLLMの音声知覚に増大する概念メモリを追加

オープンソースフレームワークのAudientは、LLMエージェントに対して継続的に音声を処理し、使用を通じて概念のメモリを構築するローカルの音声知覚レイヤーを提供します。これは、CLAP埋め込み、Whisper、Silero VAD、sqlite-vecを使用して、LLMへの呼び出しを常に必要とせずに音声イベントのゲート、指紋作成、認識を行います。

lab Hugging Face Blog · 25日前 · 14 回表示

Hume、人間の音声AIの品質を評価するReal World VoiceEQベンチマークをリリース

Humeは、Real World VoiceEQを導入しました。これは、システムがトランスクリプトを超えて音響情報をどのように認識し生成するかを評価することで、音声インタラクションの人間品質を測定するために設計されたベンチマークです。このベンチマークは、785,000件のTTSおよび48,000件のSTSの人間評価から導出された60以上の指標を用いて、15以上の次元で40以上の独自およびオープンソースモデルを評価します。

arxiv arXiv cs.CL · 25日前

統一勾配投影は多言語ASRにおける壊滅的忘却を低減する

研究者らは、Whisperのような大規模事前学習ASRモデルを低資源言語でファインチューニングする際の壊滅的忘却を緩和するための手法であるUnified Gradient Projection (UGP)を提案した。UGPは統一射影空間内での言語バランスの取れたリプレイからの参照勾配を用いてパラメータ更新を制約し、言語ごとの寄与を効果的に均等化し、支配的な言語のバイアスを低減する。

media r/LocalLLaMA · 26日前

Ciceroが任意のACPエージェントに自前ホスト型双方向音声を実現

著者は、AIエージェント向けに自前ホスト型・双方向の音声インタラクションを提供するオープンソースプロジェクト「Cicero」を紹介しています。一方通行のDictationツールとは異なり、Ciceroはエージェントが音声で応答し、Telegram経由でユーザーを呼び出すことができ、すべてのオーディオデータをローカルに保持します。

media Hugging Face Forums · 27日前

開発者が本番環境の音声AIエージェント向けオーケストレーションパターンを探る

Hugging Faceフォーラムの開発者は、大規模な手書きシステムプロンプトに頼らず、Bland.ai、Retell、Vapiといった本番プラットフォームがプロンプトオーケストレーションをどのように管理しているかを理解しようとしています。著者は、FastAPI、Sarvam STT/TTS、Pipecat SmartTurn V3を使用した現在の実装について説明し、手動の状態ごとの注入が複雑さの増大とエッジケースでの失敗につながると指摘しています。