El proyecto llama.cpp lanzó la compilación b10369, introduciendo soporte para el modelo de texto a voz pocket-tts. Esta actualización incluye una nueva implementación de convoluciones transpuestas usando GEMM y col2im para optimizar el rendimiento.
- El tiempo de generación por cuadro se reduce un 80% en CUDA y un 50% en CPU en comparación con implementaciones anteriores.
- La salida coincide con la implementación de referencia con una correlación de 0.999994 y conteos de cuadros idénticos.
- Los paquetes de idiomas ahora ajustan el relleno final del habla y el relleno de prompts cortos mediante nuevas claves mmproj.
- Una prueba con un texto largo en francés mostró una generación dentro del 2% del tiempo de referencia (22.96s vs 23.44s).
La optimización acelera significativamente la síntesis de audio manteniendo la fidelidad, y los archivos mmproj existentes deben convertirse para incluir las nuevas claves de configuración.