Le projet llama.cpp a publié la version b10635, qui inclut des mises à jour spécifiques du support CUDA. Le changement principal est le déblocage de la multiplication matricielle en précision mixte (mmq) pour les architectures Mixture of Experts (MoE) sur les GPU de capacité de calcul 6.0 (sm_60).

  • CUDA : mmq débloqué pour MoE sur sm_60.
  • CUDA : mmq-config-pascal dupliqué pour dp4a et les architectures plus anciennes.
  • CUDA : Réduction de l'occupation sur les GPU Pascal sans dp4a pour les formats de quantification Q2_K, Q4_K, Q5_K et Q6_K.

Cette version fournit des binaires pour macOS (Apple Silicon et Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm), Android et openEuler.