Le projet llama.cpp a publié la compilation b10447, qui inclut un redessin du modèle de threads `yield_to_queue`. Ce changement implique l'exécution de `common_speculative_process` dans le worker et le remplacement du design du thread worker vers le thread principal.

La version fournit des binaires pour macOS (Apple Silicon et Intel), Linux (Ubuntu avec CPU, Vulkan, OpenVINO, SYCL et ROCm désactivé), Android, Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL et ROCm 7.14) et openEuler (avec certaines compilations désactivées).

Cette mise à jour est disponible au téléchargement sur les plateformes prises en charge.