El proyecto llama.cpp lanzó la compilación b11064, que modifica el backend metal para admitir recuentos de cabezas (hc) arbitrarios en el kernel dsv4_hc_pre. Anteriormente, estos kernels tenían hc = 4 codificado, lo que hacía que las operaciones con otros recuentos de cabezas retrocedieran a la ejecución en CPU.

  • El cambio pasa n_hc como una constante de función y realiza un bucle sobre ella en ambos kernels previos con cargas directas.
  • Se agregaron casos de prueba-backend-ops para valores de hc de 1, 2, 3, 5, 8 y 65, cubriendo tanto escenarios con gating como sin gating.
  • Esta actualización permite que modelos como Kimi-K3 se ejecuten de manera eficiente en GPU al admitir recuentos de checkpoints en bancos dinámicos en la pila residual entre capas cruzadas.

El lanzamiento incluye binarios para macOS, Linux, Windows, Android y openEuler a través de varios backends de hardware que incluyen CPU, CUDA, ROCm, Vulkan, OpenVINO y SYCL.