Le projet llama.cpp a publié la version b10369, introduisant le support pour le modèle de synthèse vocale pocket-tts. Cette mise à jour inclut une nouvelle implémentation des convolutions transposées utilisant GEMM et col2im pour optimiser les performances.

  • Le temps de génération par frame est réduit de 80% sur CUDA et de 50% sur CPU par rapport aux implémentations précédentes.
  • La sortie correspond à l'implémentation de référence avec une corrélation de 0.999994 et un nombre de frames identique.
  • Les packs de langues ajustent désormais le padding de fin de parole et le padding des prompts courts via de nouvelles clés mmproj.
  • Un test sur un long texte français a montré une génération dans les 2% du temps de référence (22.96s vs 23.44s).

L'optimisation accélère considérablement la synthèse audio tout en maintenant la fidélité, et les fichiers mmproj existants doivent être convertis pour inclure les nouvelles clés de configuration.