أطلقت SpaceXAI نموذج Grok Voice Transcribe 2.0، وهو نموذج لتحويل الكلام إلى نص متاح عبر واجهة برمجة تطبيقات مستضافة، يدّعي تحقيق دقة أعلى بمرتين مقارنةً بالإصدار 1.0 عند نفس نقطة السعر. يستهدف النموذج ظروف الصوت الصعبة مثل خطوط الهاتف المشوشة والأصوات المتداخلة، ويعمل في كل من وضعي المعالجة الدفعي والبث المباشر.

  • احتل المرتبة الأولى بين 32 نموذجًا للبث على لوحة القيادة الخاصة بـ Artificial Analysis باستخدام معيار AA-WER Streaming.
  • حقق انخفاضًا في معدل الخطأ بالكلمات من 20.6% إلى 6.8% على الجمل القصيرة عبر 19 لغة، مما يمثل حوالي 67% أقل من الأخطاء.
  • يدعم الكشف التلقائي عن اللغة والتبديل بين اللغات أثناء التسجيل لعشرات اللغات.
  • يتضمن ميزات مثل تحديد المتحدثين، والطوابع الزمنية على مستوى الكلمات، وتحيز المصطلحات الرئيسية، وإزالة الكلمات الحشو دون تكلفة إضافية.
  • سعره 0.10 دولار لكل ساعة للمعالجة الدفعية و0.20 دولار لكل ساعة للبث المباشر.

اعتمدت Atlassian Loom واجهة برمجة التطبيقات هذه لتحويل كل فيديو في سير عملها، مستشهدة بدقة أعلى من حلها السابق.