llama.cpp プロジェクトは、作業メモリのサイズを制限する変更を含むビルド b10656 をリリースしました。この修正は、大きなテンソルがシステム RAM にロードされるのを防ぐために設計されています。
- このリリースでは、macOS (Apple Silicon および Intel)、iOS、Linux (Ubuntu x64、arm64、s390x)、Android、Windows、openEuler 用のバイナリが提供されます。
- サポートされているバックエンドには、CPU、Vulkan、ROCm 7.14、OpenVINO、SYCL、CUDA 12/13、OpenCL Adreno が含まれます。
- このビルドでは、macOS Apple Silicon 用の KleidiAI サポートが無効になっています。
このアップデートにより、量子化プロセス中のメモリ使用量がより安定し、作業メモリのフットプリントが制限されます。