OpenAIは、従来のターン検出器を排除し、同時に聴取と発話ができるフルデュプレックスモデルを使用して、第三世代の音声システム「GPT-Live」をリリースした。このアーキテクチャにより、リアルタイムパフォーマンスに最適化された新しいシステム設計を通じて低レイテンシを維持しながら、より即座で自然な会話が可能になる。
- システムは着信音声を音声モデルにストリーミングし、発信音声をユーザーに戻す。GPT-5.5などのフロンティアモデルを使用して、より深い推論やツール使用を非同期パスで処理する。
- メディアフローとアプリケーションロジックは専用の高速パスによって分離され、フレーム配信の滑らかさを向上させるために推論ロジックはGoで記述されている。
- シームレスなハンドオフメカニズムにより、メディアループを中断することなく、動的なコンテキスト圧縮やモデルインスタンスの移行が可能になる。
- WebRTC Abridged Roundtrip Protocol (WARP) は、起動時のネットワーク往復回数を6から1に削減する。
この基盤は、ChatGPT Voiceの機能を支え、デスクトップアプリでのコンピュータ制御やエージェント調整を実現し、アプリケーションのカスタマイズがライブメディアパスの応答性に影響を与えないことを保証する。