El proyecto llama.cpp lanzó la versión b10635, que incluye actualizaciones específicas de soporte para CUDA. El cambio principal es el desbloqueo de la multiplicación de matrices de precisión mixta (mmq) para arquitecturas Mixture of Experts (MoE) en GPUs con capacidad de cómputo 6.0 (sm_60).

  • CUDA: Desbloqueado mmq para MoE en sm_60.
  • CUDA: Duplicado mmq-config-pascal para dp4a y arquitecturas más antiguas.
  • CUDA: Reducción de ocupación en GPUs Pascal sin dp4a para formatos de cuantización Q2_K, Q4_K, Q5_K y Q6_K.

Esta versión proporciona binarios para macOS (Apple Silicon e Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm), Android y openEuler.