Le projet llama.cpp a publié la version b11190, qui inclut une correction pour le préprocesseur mel utilisé dans le modèle audio LFM2. Ce changement traite des écarts qui causaient différentes transcriptions gourmandes pour 4,5 % de l'anglais et 6,5 % des énoncés de test japonais.
- Utilise log(x + 2^-24) au lieu de bloquer au plancher logarithmique.
- Implémente une fenêtre de Hann symétrique, équivalente à torch.hann_window(periodic=False).
- Ajoute l'epsilon de normalisation à l'écart-type plutôt qu'à l'intérieur de la racine carrée.
- Réduit l'erreur L2 relative du mel par rapport à liquid-audio de ~3-4 % à une médiane de ~2e-6 pour l'anglais et le japonais.
La mise à jour garantit que le préprocesseur lfm2a correspond à la sortie de l'implémentation de référence, améliorant la précision de transcription sur plusieurs langues et formats de précision.