El proyecto llama.cpp lanzó la versión b10437, que introduce soporte nativo para los modelos de lenguaje causal MiniMax-Text-01 y MiniMax-M1. Esta actualización incluye los scripts de conversión necesarios, plantillas de chat e implementaciones de arquitectura del modelo para ejecutar estos modelos específicos dentro del marco de llama.cpp.
- Añadido soporte para `MiniMaxText01ForCausalLM` y `MiniMaxM1ForCausalLM` en la capa del modelo.
- Implementada la supresión de tokens para embeddings con valores cero para evitar interrupciones en el proceso de muestreo.
- Optimizado el rendimiento eliminando operaciones de transposición de estado y utilizando funciones comunes para una implementación concisa.
- Añadida una plantilla de chat Jinja específicamente para MiniMax-M1.
- Incluidos artefactos de compilación para macOS, Linux, Windows, Android y openEuler en CPU, GPU y varios aceleradores.
Este lanzamiento permite a los usuarios ejecutar localmente modelos MiniMax utilizando la infraestructura de inferencia existente de llama.cpp.