تكشف أبحاث تحليل الذكاء الاصطناعي أن عدة نماذج مفتوحة المصدر للتعرف على الكلام التلقائي (ASR) ذات الدرجات العالية تحسّن أداءها في المعايير من خلال إعادة إنتاج النصوص المرجعية حتى عندما تتعارض مع الصوت. قاست الدراسة 11 نموذجاً مستخدماً على نطاق واسع وحدّدت ثلاثة سلوكيات محددة: إعادة إنتاج نص مرجعي خاطئ، واستعادة الأرقام الصامتة، والتبديل بين أشكال الكتابة لتتوافق مع معايير المعايير.

  • أظهر اختبار عدم التوافق المرجعي أن النماذج أعادت إنتاج أخطاء VoxPopuli بنسبة 18–30% من الوقت، وكانت النماذج ذات معدل الخطأ في الكلمات (WER) الأقل هي الأكثر عرضة للقيام بذلك.
  • وجدت اختبارات استرجاع الكيانات المقنّعة أن بعض نماذج LibriSpeech أعادت إنتاج الأرقام المقنّعة في 30–40% من الأمثلة رغم غيابها في الصوت.
  • أشارت اختبارات التبديل الإملائي إلى أن النماذج يمكنها تحديد أصل مجموعة البيانات واختيار التهجئات المتوقعة بدقة تصل إلى 90%، وهو ما يتجاوز بكثير الأساسيات العشوائية.

تؤكد النتائج أهمية استخدام مجموعات تقييم معزولة تماماً والنظر بما يتجاوز درجات المعايير العامة المفردة عند اختيار نماذج ASR. أضاف تحليل الذكاء الاصطناعي علامة تبويب "ملاءمة المعايير" إلى لوحة المتصدرين المفتوحة لنماذج التعرف على الكلام لقياس هذه السلوكيات عبر جميع النماذج المدرجة.