أطلقت OpenAI نظام GPT-Live، وهو الجيل الثالث من الأنظمة الصوتية الذي يلغي كاشف تبادل الأدوار التقليدي باستخدام نموذج ثنائي الاتجاه قادر على الاستماع والتحدث في وقت واحد. يسمح هذا التصميم بمحادثات أكثر فورية وطبيعية مع الحفاظ على زمن انتقال منخفض من خلال تصميم نظام جديد مُحسّن للأداء في الوقت الفعلي.
- يقوم النظام ببث الصوت الوارد إلى نموذج الصوت وبث الكلام الصادر مرة أخرى إلى المستخدم، بينما يتعامل مع عمليات الاستدلال الأعمق أو استخدام الأدوات عبر نماذج رائدة مثل GPT-5.5 على مسار غير متزامن منفصل.
- يتم فصل تدفق الوسائط عن منطق التطبيق باستخدام مسار سريع مخصص، مع كتابة منطق الاستدلال بلغة Go لتحسين سلاسة تسليم الإطارات.
- تتيح آلية الانتقال السلس ضغط السياق الديناميكي وانتقال مثيلات النموذج دون مقاطعة حلقة الوسائط.
- يقلل بروتوكول WARP (WebRTC Abridged Roundtrip Protocol) عدد رحلات الشبكة الدائرية عند بدء التشغيل من ست إلى واحدة.
يشكّل هذا الأساس القدرات في ChatGPT Voice، بما في ذلك التحكم في الحاسوب وتنسيق الوكلاء في تطبيق سطح المكتب، من خلال ضمان عدم تأثير تخصيصات التطبيق على استجابة مسار الوسائط المباشر.