قام مطوّر بنشر Speakrail كمصدر مفتوح، وهو وكيل صوتي ثنائي الاتجاه يعمل محلياً بالكامل على بطاقة RTX 4090 واحدة ويتفوق على GPT-Live في بعض المقاييس. يجمع النظام بين Voxtral Realtime لتحويل الكلام إلى نص، ونموذج Gemma 4 12B المُدقّق بدقة على دورات كلامية قصيرة، وBreeze TTS 2 لتمكين التفاعلات منخفضة الكمون مع مقاطعات وردود فعل.
- يستخدم خط الأنابيب رأساً لإدارة تبادل الأدوار مرفقاً بـ Voxtral Realtime وإطلاقاً تخمينياً لـ LLM+TTS لتقليل الكمون.
- النموذج اللغوي الأساسي هو Gemma 4 12B QAT، مُدقّق بدقة على بيانات اصطناعية مع رموز تحكم للدورات القصيرة مثل <interject> و<listen>.
- تتيح آلية "التفكير أثناء التحدث" لنموذج Gemma 4 12B الأساسي بدقة int4 كتابة ملاحظات تفكيرية لمهام الاستدلال المعقدة.
- يدعم النظام الوضع الهادئ والوضع المقطوع، مما يسمح للنموذج بالاستماع أو التحدث بناءً على تحكم صريح من المستخدم.
يوفر هذا الإصدار بديلاً يحافظ على الخصوصية لمساعدي الصوت السحابيين للمستخدمين الذين يمتلكون عتاداً محلياً كافياً، رغم وجود قيود حالياً تتعلق بطول السياق والتراخيص التجارية لمكون تحويل النص إلى كلام.