Proyek llama.cpp telah merilis build b10656, yang mencakup perubahan untuk membatasi ukuran memori kerja. Modifikasi ini dirancang untuk mencegah tensor besar dimuat ke dalam RAM sistem.

  • Rilis ini menyediakan biner untuk macOS (Apple Silicon dan Intel), iOS, Linux (Ubuntu x64, arm64, s390x), Android, Windows, dan openEuler.
  • Backend yang didukung mencakup CPU, Vulkan, ROCm 7.14, OpenVINO, SYCL, CUDA 12/13, dan OpenCL Adreno.
  • Dukungan KleidiAI untuk macOS Apple Silicon dinonaktifkan dalam build ini.

Pembaruan ini memastikan penggunaan memori yang lebih stabil selama proses kuantisasi dengan membatasi jejak memori kerja.