Le projet llama.cpp a publié la version b10270, introduisant le support pour le modèle Qwen3-TTS. Cette mise à jour inclut un changement cassant pour le binaire llama-tts et implémente des modifications architecturales significatives pour gérer le nouveau flux de travail de synthèse vocale.

  • Ajout du support pour la conversion et le chargement des composants Qwen3-TTS, y compris le modèle principal, l'encodeur, l'encodeur de locuteur et code_predictor.
  • Introduction d'une nouvelle API mtmd gen et renommage du composant CODE2WAV en GEN_WAV.
  • Mise en œuvre des capacités de clonage vocal et préservation des états clé-valeur entre les appels pour améliorer la continuité.
  • Ajout des APIs llama_model_get_tok_embd et mtmd_helper_gen_audio pour une interaction améliorée avec le modèle.
  • Inclus des correctifs de sécurité, des mises à jour de documentation et le support pour divers backends matériels sur macOS, Linux, Windows et Android.