llama.cpp प्रोजेक्ट ने बिल्ड b10369 जारी किया, जिसमें pocket-tts टेक्स्ट-टू-स्पीच मॉडल के लिए समर्थन शामिल है। इस अपडेट में प्रदर्शन को अनुकूलित करने के लिए GEMM और col2im का उपयोग करके ट्रांसपोज्ड कन्वोल्यूशन्स की एक नई कार्यान्वयन शामिल है।

  • पिछले कार्यान्वयनों की तुलना में CUDA पर प्रति फ्रेम जनरेशन समय 80% कम हो जाता है और CPU पर 50% कम हो जाता है।
  • आउटपुट संदर्भ कार्यान्वयन से मेल खाता है, जिसमें सहसंबंध 0.999994 है और फ्रेम गणना समान है।
  • भाषा पैक अब नए mmproj कुंजी के माध्यम से स्पीच के अंत में पैडिंग और छोटे प्रॉम्प्ट पैडिंग को ट्यून करते हैं।
  • एक लंबे फ्रेंच टेक्स्ट पर टेस्ट ने संदर्भ समय के 2% के भीतर जनरेशन दिखाया (22.96s बनाम 23.44s)।

अनुकूलन ने ऑडियो सिंथेसिस को महत्वपूर्ण रूप से तेज किया है जबकि विश्वसनीयता बनाए रखी है, और मौजूदा mmproj फ़ाइलों को नई कॉन्फ़िगरेशन कुंजी ले जाने के लिए परिवर्तित करना होगा।