O projeto llama.cpp lançou a compilação b10447, que inclui um redesenho do modelo de threads `yield_to_queue`. Esta alteração envolve executar `common_speculative_process` no worker e trocar o design da thread worker para a principal.
O lançamento fornece binários para macOS (Apple Silicon e Intel), Linux (Ubuntu com CPU, Vulkan, OpenVINO, SYCL e ROCm desativado), Android, Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL e ROCm 7.14) e openEuler (com algumas compilações desabilitadas).
Esta atualização está disponível para download nas plataformas suportadas.