Le projet llama.cpp a publié la compilation b10868, qui introduit la gestion des types IQ pour les modèles Mixture of Experts (MoE).

  • Ajoute le support des types de quantification IQ dans les architectures MoE via la pull request #28476.
  • Fournit des binaires pour macOS (Apple Silicon et Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Windows (CPU, CUDA 12/13, Vulkan, OpenCL, ROCm, SYCL), Android et openEuler.
  • Inclut le support iOS XCFramework et un package d'interface utilisateur autonome.

Cette mise à jour permet aux utilisateurs d'exécuter des modèles MoE avec des types de quantification IQ spécifiques sur une large gamme de plateformes matérielles.