El proyecto llama.cpp lanzó la versión b11190, que incluye una corrección para el preprocesador mel utilizado en el modelo de audio LFM2. Este cambio aborda discrepancias que causaban diferentes transcripciones codiciosas para el 4,5 % del inglés y el 6,5 % de los enunciados de prueba en japonés.

  • Usa log(x + 2^-24) en lugar de recortar al piso logarítmico.
  • Implementa una ventana de Hann simétrica, equivalente a torch.hann_window(periodic=False).
  • Añade la epsilon de normalización a la desviación estándar en lugar de dentro de la raíz cuadrada.
  • Reduce el error L2 relativo de mel frente a liquid-audio de ~3-4 % a una mediana de ~2e-6 tanto para inglés como para japonés.

La actualización asegura que el preprocesador lfm2a coincida con la salida de la implementación de referencia, mejorando la precisión de transcripción en múltiples idiomas y formatos de precisión.