llama.cpp परियोजना ने संस्करण b11190 जारी किया, जिसमें LFM2 ऑडियो मॉडल में उपयोग किए जाने वाले mel प्रीप्रोसेसर के लिए एक सुधार शामिल है। यह बदलाव उन असंगतियों को दूर करता है जो अंग्रेजी के 4.5% और जापानी के 6.5% परीक्षण उच्चारणों के लिए अलग-अलग लालची ट्रांसक्रिप्शन का कारण बन रहे थे।

  • लॉग फ्लोर पर क्लैम्पिंग के बजाय log(x + 2^-24) का उपयोग करता है।
  • एक सममित हान विंडो लागू करता है, जो torch.hann_window(periodic=False) के समतुल्य है।
  • वर्गमूल के अंदर नहीं, बल्कि मानक विचलन में सामान्यीकरण एप्सिलॉन जोड़ता है।
  • लिक्विड-ऑडियो की तुलना में mel सापेक्ष L2 त्रुटि को ~3-4% से अंग्रेजी और जापानी दोनों के लिए ~2e-6 मध्यिका तक कम करता है।

अपडेट सुनिश्चित करता है कि lfm2a प्रीप्रोसेसर संदर्भ कार्यान्वयन के आउटपुट से मेल खाता है, जिससे कई भाषाओं और सटीकता फॉर्मेट्स में ट्रांसक्रिप्शन सटीकता में सुधार होता है।