أطلقت xAI نموذج Grok Voice Transcribe 2.0، وهو نموذج لتحويل الكلام إلى نص يكون أكثر دقة مرتين من الإصدار 1.0 مع الحفاظ على نفس السعر. مبني على النموذج الأساسي للصوت وراء Grok Voice، يستفيد من مجموعة بيانات فريدة من الصوت متعدد اللغات المباشر والمليء بالضوضاء للتعامل مع ظروف العالم الحقيقي الصعبة مثل خطوط الهاتف غير المستمرة والأصوات المتنافسة.

  • يحتل المرتبة الأولى في الدقة بين 32 نموذجًا للبث على لوحة القيادة العامة لـ Artificial Analysis.
  • يحسن معدل خطأ الكلمات في العبارات القصيرة من 20.6% إلى 6.8%, مما يمثل أكبر تحسين متعدد اللغات.
  • يتصدر كل النماذج المختبرة في الصوت التليفوني ويحسن الأداء عبر أربع مجموعات بيانات إنتاج داخلية.
  • يكتشف اللغة تلقائيًا ويتعامل مع التبديلات أثناء التسجيل في تمرين واحد لعشرات اللغات.

ستصبح التحديثات قريبًا هي الافتراضية في Speech-to-Text API، مع جدولة الإصدار 1.0 للتقاعد في الأسابيع القادمة.