Proyek llama.cpp merilis build b10369, memperkenalkan dukungan untuk model text-to-speech pocket-tts. Pembaruan ini mencakup implementasi baru konvolusi transpos menggunakan GEMM dan col2im untuk mengoptimalkan kinerja.
- Waktu generasi per frame turun 80% pada CUDA dan 50% pada CPU dibandingkan implementasi sebelumnya.
- Output cocok dengan implementasi referensi dengan korelasi 0.999994 dan jumlah frame yang identik.
- Paket bahasa sekarang menyesuaikan padding akhir ucapan dan padding prompt pendek melalui kunci mmproj baru.
- Tes teks panjang bahasa Prancis menunjukkan generasi dalam 2% dari waktu referensi (22,96s vs 23,44s).
Optimisasi secara signifikan mempercepat sintesis audio sambil mempertahankan fidelitas, dan file mmproj yang ada harus dikonversi untuk membawa kunci konfigurasi baru.