Proyek llama.cpp telah merilis versi b10539, yang mengatasi masalah stabilitas numerik kritis di backend Vulkan sambil memperluas dukungan perangkat keras untuk pengguna Windows.

  • Vulkan FA MMQ sekarang menggunakan fp32 untuk perhitungan kuantisasi Q untuk mencegah overflow ketika qd adalah denorm.
  • Ditambahkan biner Windows x64 untuk CUDA 13 dan dukungan preview untuk Windows arm64 dengan CUDA 13.4.
  • Termasuk build untuk Ubuntu s390x (CPU), macOS Intel (x64), dan iOS XCFramework.
  • Dukungan OpenCL Adreno kini tersedia untuk Windows arm64.

Pembaruan ini memastikan kinerja yang andal pada perangkat Vulkan dengan mencegah kesalahan aritmatika dan memberikan pengguna opsi kompatibilitas CUDA 13 terbaru.