Проект llama.cpp выпустил версию b11190, которая включает исправление для мел-препроцессора, используемого в аудио модели LFM2. Это изменение устраняет расхождения, вызывавшие разные жадные транскрипты для 4,5% английских и 6,5% японских тестовых высказываний.
- Использует log(x + 2^-24) вместо ограничения по нижнему пределу логарифма.
- Реализует симметричное окно Ханна, эквивалентное torch.hann_window(periodic=False).
- Добавляет нормализационный эпсилон к стандартному отклонению, а не внутрь квадратного корня.
- Снижает относительную L2 ошибку мела по сравнению с liquid-audio с ~3-4% до медианного значения ~2e-6 как для английского, так и для японского языков.
Обновление гарантирует, что препроцессор lfm2a соответствует выходным данным эталонной реализации, улучшая точность транскрипции для нескольких языков и форматов точности.