Proyek llama.cpp merilis build b11064, yang memodifikasi backend metal untuk mendukung jumlah kepala (hc) sembarang dalam kernel dsv4_hc_pre. Sebelumnya, kernel-kernel ini memiliki hc = 4 yang dikodekan secara tetap, menyebabkan operasi dengan jumlah kepala lain kembali ke eksekusi CPU.

  • Perubahan ini meneruskan n_hc sebagai konstanta fungsi dan melakukan loop di atasnya di kedua kernel pre dengan muatan langsung.
  • Kasus test-backend-ops ditambahkan untuk nilai hc 1, 2, 3, 5, 8, dan 65, mencakup skenario dengan gating dan tanpa gating.
  • Pembaruan ini memungkinkan model seperti Kimi-K3 berjalan secara efisien di GPU dengan mendukung jumlah checkpoint bank dinamis dalam tumpukan residual antar lapisan silang.

Rilis ini mencakup biner untuk macOS, Linux, Windows, Android, dan openEuler di berbagai backend perangkat keras termasuk CPU, CUDA, ROCm, Vulkan, OpenVINO, dan SYCL.