El proyecto llama.cpp lanzó la versión b10437, que introduce soporte nativo para los modelos de lenguaje causal MiniMax-Text-01 y MiniMax-M1. Esta actualización incluye los scripts de conversión necesarios, plantillas de chat e implementaciones de arquitectura del modelo para ejecutar estos modelos específicos dentro del marco de llama.cpp.

  • Añadido soporte para `MiniMaxText01ForCausalLM` y `MiniMaxM1ForCausalLM` en la capa del modelo.
  • Implementada la supresión de tokens para embeddings con valores cero para evitar interrupciones en el proceso de muestreo.
  • Optimizado el rendimiento eliminando operaciones de transposición de estado y utilizando funciones comunes para una implementación concisa.
  • Añadida una plantilla de chat Jinja específicamente para MiniMax-M1.
  • Incluidos artefactos de compilación para macOS, Linux, Windows, Android y openEuler en CPU, GPU y varios aceleradores.

Este lanzamiento permite a los usuarios ejecutar localmente modelos MiniMax utilizando la infraestructura de inferencia existente de llama.cpp.