llama.cpp プロジェクトはバージョン b10427 をリリースしました。これには SYCL を介した Intel Arc GPU 向けの性能最適化が含まれています。このアップデートでは、q4_K 密なフィードフォワードネットワーク (FFN) レヤー内で gate、up、GLU 演算の融合が実装されました。
- llama-bench を使用して Arc Pro B70 で測定した結果、qwen2.5-3B-Instruct のスループットは 2.8% 向上し、gemma-2-2b-it は 2.0% 向上しました。
- qwen2.5-3B でのバッチ推論ベンチマークでは顕著な改善が見られました:バッチサイズ 1 で +3.4%、B=2 で +10.1% に増加し、B=4 で +10.7%、B=8 で +12.4% となりました。
このリリースでは、CPU、CUDA、Vulkan、ROCm、OpenVINO のバックエンド向けに、macOS、Linux、Windows、Android、openEuler 用のプリコンパイル済みバイナリが提供されています。