O projeto llama.cpp lançou a versão b11190, que inclui uma correção para o pré-processador mel usado no modelo de áudio LFM2. Esta alteração aborda discrepâncias que causavam transcrições ganhosas diferentes para 4,5% do inglês e 6,5% das falagens de teste em japonês.

  • Usa log(x + 2^-24) em vez de limitar ao piso logarítmico.
  • Implementa uma janela de Hann simétrica, equivalente a torch.hann_window(periodic=False).
  • Adiciona a epsilon de normalização ao desvio padrão em vez de dentro da raiz quadrada.
  • Reduz o erro L2 relativo do mel em relação ao liquid-audio de ~3-4% para uma mediana de ~2e-6 tanto para inglês quanto para japonês.

A atualização garante que o pré-processador lfm2a corresponda à saída da implementação de referência, melhorando a precisão da transcrição em vários idiomas e formatos de precisão.