Artificial Analysis की शोध से पता चलता है कि कई उच्च-स्कोर वाले ओपन-सोर्स ऑटोमैटिक स्पीच रिकग्निशन (ASR) मॉडल बेंचमार्क्स के लिए ऑप्टिमाइज़ करते हैं, भले ही ऑडियो उनका विरोध करे, तब भी वे रेफरेंस ट्रांसक्रिप्ट को पुनः उत्पन्न करते हैं। इस अध्ययन में 11 व्यापक रूप से उपयोग किए जाने वाले मॉडलों का मूल्यांकन किया गया और तीन विशिष्ट व्यवहारों की पहचान की गई: त्रुटिपूर्ण रेफरेंस टेक्स्ट को पुनः उत्पन्न करना, शांत संख्याओं को पुनः प्राप्त करना, और बेंचमार्क रूढ़ियों से मेल खाने के लिए वर्तनी के विकल्पों को बदलना।
- रेफरेंस असहमति प्रोब ने दिखाया कि मॉडल 18–30% समय में VoxPopuli त्रुटियों को पुनः उत्पन्न करते हैं, जिसमें कम शब्द त्रुटि दर (WER) वाले मॉडल ऐसा करने की सबसे अधिक संभावना रखते हैं।
- मैस्क्ड एंटिटी रिट्रीवल टेस्ट में पाया गया कि कुछ LibriSpeech मॉडल 30–40% उदाहरणों में ऑडियो में उनकी अनुपस्थिति के बावजूद मैस्क्ड संख्याओं को पुनः उत्पन्न करते हैं।
- ऑर्थोग्राफिक स्विचिंग प्रोब ने संकेत दिया कि मॉडल डेटासेट की उत्पत्ति की पहचान कर सकते हैं और 90% तक सटीकता के साथ अपेक्षित वर्तनी का चयन कर सकते हैं, जो यादृच्छिक आधार से कहीं अधिक है।
इन निष्कर्षों पर ASR मॉडल चुनते समय पूरी तरह से अलग मूल्यांकन सेट का उपयोग करने और केवल एक सार्वजनिक बेंचमार्क स्कोर से आगे देखने के महत्व पर जोर दिया गया है। Artificial Analysis ने सभी सूचीबद्ध मॉडलों में इन व्यवहारों को मात्रात्मक रूप देने के लिए ओपन ASR लीडरबोर्ड में एक "बेंचमार्क फिटिंग" टैब जोड़ा है।