OpenAIはAPIでGPT-Live-1をリリースし、開発者が音声対応アプリケーションを構築できるよう、同時に聴取と発話を行う単一モデルを提供した。このリリースは、従来の連鎖型アーキテクチャを一元的なアプローチに置き換え、割り込みやコンテキストをより自然に処理することで、音声レイヤーの開発を簡素化することを目指している。
主な機能には、入力音声と出力音声を共同推論することで割り込み処理を改善し、GPT-6 Astraやサードパーティ製システムなどのバックエンドモデルに深い推論タスクを委譲する能力が含まれる。このモデルはシステムプロンプトを通じてトーン、ペース、スタイルのカスタマイズをサポートし、背景ノイズや沈黙を効果的に管理し、長時間のセッション全体で信頼性を確保する。
評価結果によると、GPT-Live-1はGPT-Realtime-2.1と比較してFull Duplex Benchのパフォーマンスが30ポイント向上し、GPT-6 Astraと組み合わせた場合、音声エージェントの知能に関するTau3ベンチマークで第1位を獲得した。フロントエンドの音声レイヤー向けに現在1分あたり$0.05で利用可能であり、今後数ヶ月以内に音声オプションと言語対応が拡大される予定だ。