Проект llama.cpp выпустил сборку b10369, добавившую поддержку модели преобразования текста в речь pocket-tts. Это обновление включает новую реализацию транспонированных свёрток с использованием GEMM и col2im для оптимизации производительности.
- Время генерации на кадр сокращается на 80% на CUDA и на 50% на CPU по сравнению с предыдущими реализациями.
- Результат совпадает с эталонной реализацией с корреляцией 0.999994 и идентичным количеством кадров.
- Языковые пакеты теперь настраивают завершающую паузу и короткую паузу промпта через новые ключи mmproj.
- Тест с длинным французским текстом показал генерацию в пределах 2% от эталонного времени (22.96s против 23.44s).
Оптимизация значительно ускоряет синтез аудио, сохраняя качество, а существующие файлы mmproj необходимо конвертировать для поддержки новых ключей конфигурации.