llama.cpp プロジェクトはビルド b10447 をリリースしました。これには `yield_to_queue` スレッドモデルの再設計が含まれています。この変更では、ワーカーで `common_speculative_process` を実行し、ワーカーからメインスレッドへのデザインを切り替えます。

今回のリリースでは、macOS(Apple Silicon および Intel)、Linux(Ubuntu の CPU、Vulkan、OpenVINO、SYCL、無効化された ROCm)、Android、Windows(CPU、OpenCL、CUDA 12/13、Vulkan、OpenVINO、SYCL、ROCm 7.14)、openEuler(一部のビルドが無効)向けのバイナリが提供されています。

このアップデートは、サポートされているプラットフォームすべてでダウンロード可能です。