Le projet llama.cpp a publié la version b10870, introduisant le support Vulkan pour les pipelines de multiplication matricielle f16 type B et le réglage de la taille du tile warp spécifiquement pour le matériel Intel coopmat1.
- Ajout des pipelines de multiplication matricielle f16 type B et du réglage de la taille du tile warp pour Intel coopmat1.
- Activation du pipeline f16 type B pour la multiplication matricielle dense sur tous les fournisseurs, tout en maintenant le support Mixture of Experts (MoE) uniquement pour Intel.
- Ajout des branches OCP FP4 manquantes et restriction de required_subgroup_size à Intel.
- Simplification et affinage de la sélection de mmp dans mul_mat_id.
Cette mise à jour étend la compatibilité Vulkan pour certaines opérations matricielles et affine la logique de sélection interne pour améliorer l'utilisation du matériel.