O projeto llama.cpp lançou a compilação b10311, que inclui uma correção para o pipeline do Qwen3-TTS. A atualização resolve um problema em que o modelo lia a fala de entrada duas vezes durante a geração.
- Corrige um bug na sobreposição de pré-preenchimento não streaming que causava o reenvio do fluxo de texto durante a geração do Qwen3-TTS.
- Corrige o estado oculto do texto final para colapsar em uma única linha tts_pad, correspondendo ao layout do pré-preenchimento.
- Fornece binários para macOS (Apple Silicon e Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, ROCm, SYCL) e openEuler.