Le projet llama.cpp a publié la version b11190, qui inclut une correction pour le préprocesseur mel utilisé dans le modèle audio LFM2. Ce changement traite des écarts qui causaient différentes transcriptions gourmandes pour 4,5 % de l'anglais et 6,5 % des énoncés de test japonais.

  • Utilise log(x + 2^-24) au lieu de bloquer au plancher logarithmique.
  • Implémente une fenêtre de Hann symétrique, équivalente à torch.hann_window(periodic=False).
  • Ajoute l'epsilon de normalisation à l'écart-type plutôt qu'à l'intérieur de la racine carrée.
  • Réduit l'erreur L2 relative du mel par rapport à liquid-audio de ~3-4 % à une médiane de ~2e-6 pour l'anglais et le japonais.

La mise à jour garantit que le préprocesseur lfm2a correspond à la sortie de l'implémentation de référence, améliorant la précision de transcription sur plusieurs langues et formats de précision.