Proyek llama.cpp merilis versi b11190, yang mencakup perbaikan untuk preprosesor mel yang digunakan dalam model audio LFM2. Perubahan ini mengatasi ketidaksesuaian yang menyebabkan transkripsi serakah berbeda untuk 4,5% bahasa Inggris dan 6,5% ucapan uji bahasa Jepang.
- Menggunakan log(x + 2^-24) alih-alih menjepit ke lantai log.
- Mengimplementasikan jendela Hann simetris, setara dengan torch.hann_window(periodic=False).
- Menambahkan epsilon normalisasi ke simpangan baku daripada di dalam akar kuadrat.
- Mengurangi kesalahan L2 relatif mel dibandingkan liquid-audio dari ~3-4% menjadi median ~2e-6 untuk bahasa Inggris dan Jepang.
Pembaruan ini memastikan bahwa preprosesor lfm2a cocok dengan output implementasi referensi, meningkatkan akurasi transkripsi di berbagai bahasa dan format presisi.