Le projet llama.cpp a publié la compilation b10311, qui inclut une correction pour le pipeline Qwen3-TTS. La mise à jour résout un problème où le modèle lisait deux fois l'énoncé d'entrée pendant la génération.

  • Corrige un bug dans la surcouche de pré-remplissage non streaming qui causait l'alimentation à nouveau du flux texte pendant la génération Qwen3-TTS.
  • Corrige l'état caché du texte final pour qu'il se réduise à une seule ligne tts_pad, correspondant à la disposition du pré-remplissage.
  • Fournit des binaires pour macOS (Apple Silicon et Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, ROCm, SYCL) et openEuler.