Проект llama.cpp выпустил сборку b10311, которая включает исправление для конвейера Qwen3-TTS. Обновление устраняет проблему, при которой модель дважды читала входную фразу во время генерации.

  • Исправлена ошибка в нестриминговом оверлее префиксного заполнения (prefill), из-за которой текстовый поток подавался повторно во время генерации Qwen3-TTS.
  • Исправлено скрытое состояние конечного текста для сворачивания в один ряд tts_pad, что соответствует макету префиксного заполнения.
  • Предоставлены бинарные файлы для macOS (Apple Silicon и Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, ROCm, SYCL) и openEuler.