トピック · Voice & audio
lab xAI News · 12日前 · 30 回表示

xAI、v1の2倍の精度を持つGrok Voice Transcribe 2.0をリリース

xAIは、バージョン1.0の2倍の精度を持ちながら同じ価格を維持する音声からテキストへの変換モデルであるGrok Voice Transcribe 2.0をリリースしました。Grok Voiceの背後にあるオーディオ基盤モデルに基づいて構築され、不安定な電話回線や競合する音声など、困難な現実世界の条件に対応するために、ライブでノイズのある多言語オーディオの独自のデータセットを活用しています。

lab OpenAI News · 20日前 τ²-bench · 1.0% · 58 回表示

OpenAI、自然な音声体験向けGPT-Live-1 APIをリリース

OpenAIはAPIでGPT-Live-1をリリースし、開発者が音声対応アプリケーションを構築できるよう、同時に聴取と発話を行う単一モデルを提供した。このリリースは、従来の連鎖型アーキテクチャを一元的なアプローチに置き換え、割り込みやコンテキストをより自然に処理することで、音声レイヤーの開発を簡素化することを目指している。

lab Hugging Face Blog · 4時間前 · 1 回表示

Open TTS Leaderboardがスケーラブルな多言語TTS評価を公開

Open TTS Leaderboardは、Text-to-Speech (TTS) 評価における断片化と標準化の欠如に対処するため、遅くアリーナベースの人間による好みスコアに依存するのではなく、客観的な指標を使用してリリースされました。Qwen3 ASRおよびWavLM埋め込みを用いて、明瞭性、速度、話者類似性の各モデルを評価します。

media MarkTechPost · 1日前 · 3 回表示

アリババのQwenチームが全二重音声モデル「Qwen-Audio-3.1-Realtime」をリリース

アリババのQwenチームは、新しいQwen-Audio-3.1-Realtime-plusを含む5つのモデルからなるオーディオスタックであるQwen-Audio-3.1をリリースしました。これは、推論やツール使用が可能な音声エージェント向けに設計された全二重音声モデルです。また、本リリースではASRサービスの料金が最大95%引き下げられました。

media MarkTechPost · 7日前 · 5 回表示

Googleがプロンプトベースの音声デザイン機能を備えたGemini 3.8 Flash TTSおよびFlash-Lite TTSをリリース

Googleは、そのGemini Audioファミリーの一環として、2つの新しいテキスト読み上げモデルであるGemini 3.8 Flash TTSとGemini 3.8 Flash-Lite TTSをリリースした。これらのモデルは、自然言語のプロンプトからの生成型音声デザインや、Gemini APIおよびGoogle AI Studioを通じた行ごとのパフォーマンス指示を導入している。

media MarkTechPost · 7日前 · 16 回表示

NVIDIAが8人の話者を追跡する1億パラメータのモデル「Nemotron 3 Diarization」をリリース

NVIDIAは、Hugging FaceでOpenMDWライセンス1.1の下で公開されているオープンウェイトの話者 diarization モデル「Nemotron 3 Diarization」をリリースしました。この1億パラメータのモデルは、単一のチェックポイントを使用して、リアルタイムまたはオフラインモードで最大8人の重なり合う話者を追跡します。

arxiv arXiv cs.CL · 10日前 · 17 回表示

NemotronLabsがツール呼び出し機能を備えたオープンなフルデュープレックス音声対話モデル「VoiceChat」をリリース

NemotronLabsは、聴取、文字起こし、推論、発話を統一されたストリーミングアーキテクチャ内で統合するために設計されたオープンウェイトのフルデュープレックス音声対話モデルであるVoiceChatを発表した。本システムは、ストリーミング音声エンコーダとデコーダのみからなる言語モデルを組み合わせ、エージェントテキストおよび構造化関数呼び出し用の並列専用出力ストリームに加え、逐次ユーザー文字起こし用の補助的なRNN-Tブランチを搭載している。

arxiv arXiv cs.AI · 10日前 · 17 回表示

NemotronLabsがツール呼び出し機能を備えたオープンなフルデュプレックス音声対音声モデル「VoiceChat」をリリース

NemotronLabsは、統合ストリーミングアーキテクチャ内でネイティブのツール呼び出し機能を統合したオープンウェイトのフルデュプレックス音声対音声モデルであるNemotronLabs VoiceChatを発表しました。本システムは、ストリーミング音声エンコーダとデコーダのみからなる言語モデルを組み合わせ、エージェントテキストと構造化された関数呼び出し用の並列出力ストリームに加え、増分的な文字起こし用の補助RNN-TブランチおよびストリーミングTTSデコーダを備えています。

media MarkTechPost · 12日前 · 16 回表示

SpaceXAIがGrok Voice Transcribe 2.0 APIを公開、精度が2倍と主張

SpaceXAIは、ホストされたAPIを通じて提供される音声からテキストへの変換モデル「Grok Voice Transcribe 2.0」をリリースしました。このモデルは、同じ価格帯でバージョン1.0の約2倍の精度を実現すると主張しています。本モデルは、ノイズの多い電話回線や競合する音声といった困難な音声環境を対象としており、バッチ処理とリアルタイムストリーミングの両方のモードで動作します。

media Hugging Face Forums · 21日前 · 15 回表示

Aidenはリアルタイム音声とタスク実行を別々のモデルに分割することを提案

Aidenは、複雑な視覚推論とデバイス操作を伴うフルデュプレックスの音声会話が必要で、両方を処理する単一モデルの制限を回避するエージェント向けのアーキテクチャを説明しています。この解決策は責任を分割します:リアルタイム音声モデルが会話を管理し、別個のより強力なモデルがバックグラウンドタスクを実行し、タスクキューを通じて非同期に調整します。