El proyecto llama.cpp lanzó la compilación b11059, que introduce actualizaciones significativas en el backend Metal para hardware Apple Silicon. El cambio principal es la adición de soporte de entrada F16 al kernel Fast Walsh-Hadamard Transform (FWHT), permitiendo leer fuentes F16 directamente sin necesidad de una copia convertida.

  • El kernel FWHT de Metal ahora acepta entrada F16 haciendo que el tipo de fuente sea un parámetro de plantilla, mientras que las instanciaciones F32 permanecen sin cambios.
  • Una selección mariposa sin ramificaciones en el kernel SIMD del grupo FWHT reemplaza los operadores ternarios, generando una ganancia de rendimiento del 3.0% (1285.0 us frente a 1324.6 us) en un M5 Pro para matmuls Hadamard grandes.
  • Los predicados de envío se movieron a ggml-metal-common para corregir la compilación macos-latest-arm64 y garantizar la coherencia entre supports_op y la lógica de envío.
  • La versión incluye binarios para macOS, iOS, Linux, Windows, Android y openEuler a través de los backends CPU, CUDA, ROCm, Vulkan, OpenVINO y SYCL.

Esta actualización mejora la eficiencia en Apple Silicon al reducir la sobrecarga de memoria y la latencia para las operaciones F16 en el backend Metal.