Le projet llama.cpp a publié la version b10142, qui introduit un support préliminaire de la vision pour le modèle MiniMax-M3. Cette mise à jour implémente un portage en mode texte uniquement qui réutilise les composants existants de MiniMax-M2, notamment GQA avec QK-norm par tête et rotation partielle, experts de style DeepSeek-V3 et activation swigluoai.

  • L'implémentation inclut la tour de vision MiniMax-M3 (mmproj + graphe clip) tout en supprimant les têtes MTP et le support de l'attention clairsemée.
  • Les optimisations de performances incluent la décomposition des opérations CPU lentes en opérations GPU/CPU pour des accélérations massives sur les contextes longs et la réécriture de l'opérateur d'indexation pour qu'il soit natif CUDA.
  • Un chemin unifié 4 voies + decode réduit le nombre de nœuds par couche d'environ 50 à environ 25, réduisant les tampons de calcul d'environ 20 %.
  • Les effets mesurés montrent une augmentation des vitesses de décodage de 6,2–7,15 t/s à 7,7–7,8 t/s sur les configurations de déschargement des experts, le préremplissage devenant environ 10 % plus rapide.

Tous les GGUF générés avant cette modification doivent être régénérés pour garantir la compatibilité avec la nouvelle architecture et la logique de conversion.