Voice & audio
arxiv arXiv cs.CL · 2日前 · 13 回表示

NemotronLabsがツール呼び出し機能を備えたオープンなフルデュープレックス音声対話モデル「VoiceChat」をリリース

NemotronLabsは、聴取、文字起こし、推論、発話を統一されたストリーミングアーキテクチャ内で統合するために設計されたオープンウェイトのフルデュープレックス音声対話モデルであるVoiceChatを発表した。本システムは、ストリーミング音声エンコーダとデコーダのみからなる言語モデルを組み合わせ、エージェントテキストおよび構造化関数呼び出し用の並列専用出力ストリームに加え、逐次ユーザー文字起こし用の補助的なRNN-Tブランチを搭載している。

arxiv arXiv cs.AI · 2日前 · 13 回表示

NemotronLabsがツール呼び出し機能を備えたオープンなフルデュプレックス音声対音声モデル「VoiceChat」をリリース

NemotronLabsは、統合ストリーミングアーキテクチャ内でネイティブのツール呼び出し機能を統合したオープンウェイトのフルデュプレックス音声対音声モデルであるNemotronLabs VoiceChatを発表しました。本システムは、ストリーミング音声エンコーダとデコーダのみからなる言語モデルを組み合わせ、エージェントテキストと構造化された関数呼び出し用の並列出力ストリームに加え、増分的な文字起こし用の補助RNN-TブランチおよびストリーミングTTSデコーダを備えています。

media MarkTechPost · 4日前 · 14 回表示

SpaceXAIがGrok Voice Transcribe 2.0 APIを公開、精度が2倍と主張

SpaceXAIは、ホストされたAPIを通じて提供される音声からテキストへの変換モデル「Grok Voice Transcribe 2.0」をリリースしました。このモデルは、同じ価格帯でバージョン1.0の約2倍の精度を実現すると主張しています。本モデルは、ノイズの多い電話回線や競合する音声といった困難な音声環境を対象としており、バッチ処理とリアルタイムストリーミングの両方のモードで動作します。

lab xAI News · 5日前 · 24 回表示

xAI、v1の2倍の精度を持つGrok Voice Transcribe 2.0をリリース

xAIは、バージョン1.0の2倍の精度を持ちながら同じ価格を維持する音声からテキストへの変換モデルであるGrok Voice Transcribe 2.0をリリースしました。Grok Voiceの背後にあるオーディオ基盤モデルに基づいて構築され、不安定な電話回線や競合する音声など、困難な現実世界の条件に対応するために、ライブでノイズのある多言語オーディオの独自のデータセットを活用しています。

lab OpenAI News · 13日前 τ²-bench · 1.0% · 52 回表示

OpenAI、自然な音声体験向けGPT-Live-1 APIをリリース

OpenAIはAPIでGPT-Live-1をリリースし、開発者が音声対応アプリケーションを構築できるよう、同時に聴取と発話を行う単一モデルを提供した。このリリースは、従来の連鎖型アーキテクチャを一元的なアプローチに置き換え、割り込みやコンテキストをより自然に処理することで、音声レイヤーの開発を簡素化することを目指している。

media Hugging Face Forums · 13日前 · 12 回表示

Aidenはリアルタイム音声とタスク実行を別々のモデルに分割することを提案

Aidenは、複雑な視覚推論とデバイス操作を伴うフルデュプレックスの音声会話が必要で、両方を処理する単一モデルの制限を回避するエージェント向けのアーキテクチャを説明しています。この解決策は責任を分割します:リアルタイム音声モデルが会話を管理し、別個のより強力なモデルがバックグラウンドタスクを実行し、タスクキューを通じて非同期に調整します。

arxiv arXiv cs.LG · 14日前 · 24 回表示

TontaubeV1が有界コンテキストでのストリーミング音声合成を実現

研究者らは、TontaubeV1を発表した。これは自然な抑揚を維持しつつ、単一の消費者向けGPUからストリーミング推論を可能にする音声合成モデルである。本システムは、意味的なストリームと音響的詳細を分離するために、12.5 Hzの階層的DualCodec表現を使用し、低遅延生成を実現する。

arxiv arXiv cs.CL · 14日前 · 25 回表示

TontaubeV1が有界コンテキストによるストリーミングテキスト音声合成を実現

研究者らは、自然な抑揚を維持しつつ単一の消費者向けGPUからのストリーミング推論を可能にするテキスト音声合成モデル「TontaubeV1」を発表した。本システムは、意味的なストリームと音響的詳細を分離するために12.5 Hzの階層的DualCodec表現を使用し、基盤となるコーデックが非因果的であるにもかかわらず因果的なデコーディングを可能にしている。

media MarkTechPost · 21日前 · 26 回表示

Meta Superintelligence LabsがMuse Voice Transcribeをリリース

Meta Superintelligence Labsは、ストリーミング自動音声認識(ASR)、20人以上の話者 diarization、およびエンドポイント検出を一度のパスで実行する単一の自己回帰モデルであるMuse Voice Transcribeをリリースしました。このモデルは、muse-voice-transcribe-1.0という名前でMeta Model API上でホストされたAPIとして利用可能です。