Le projet llama.cpp a publié la version b10437, qui introduit la prise en charge native des modèles de langage causal MiniMax-Text-01 et MiniMax-M1. Cette mise à jour inclut les scripts de conversion nécessaires, les modèles de chat et les implémentations d'architecture du modèle pour exécuter ces modèles spécifiques dans le cadre de llama.cpp.
- Ajout du support pour `MiniMaxText01ForCausalLM` et `MiniMaxM1ForCausalLM` au niveau de la couche modèle.
- Implémentation de la suppression des tokens pour les embeddings avec des valeurs nulles afin d'éviter de perturber le processus d'échantillonnage.
- Optimisation des performances en supprimant les opérations de transposition d'état et en utilisant des fonctions communes pour une implémentation concise.
- Ajout d'un modèle de chat Jinja spécifiquement pour MiniMax-M1.
- Inclusion des artefacts de build pour macOS, Linux, Windows, Android et openEuler sur CPU, GPU et divers accélérateurs.
Cette version permet aux utilisateurs d'exécuter localement les modèles MiniMax en utilisant l'infrastructure d'inférence existante de llama.cpp.