El proyecto llama.cpp lanzó la compilación b10142, que introduce soporte preliminar para visión del modelo MiniMax-M3. Esta actualización implementa un puerto solo de texto que reutiliza componentes existentes de MiniMax-M2, incluyendo GQA con QK-norm por cabeza y rotativo parcial, expertos al estilo DeepSeek-V3 y activación swigluoai.
- La implementación incluye la torre de visión MiniMax-M3 (mmproj + gráfico clip) mientras elimina las cabezas MTP y el soporte de atención dispersa.
- Las optimizaciones de rendimiento incluyen descomponer operaciones lentas de CPU en ops de GPU/CPU para aceleraciones masivas en contextos largos y reescribir la op del indexador para que sea nativa de CUDA.
- Una ruta unificada 4-way + decode reduce los nodos por capa de ~50 a ~25, reduciendo los búferes de cómputo aproximadamente un 20%.
- Los efectos medidos muestran que las velocidades de decode aumentan de 6.2–7.15 t/s a 7.7–7.8 t/s en configuraciones con descarga de expertos, mientras que el prefill se vuelve alrededor de un 10% más rápido.
Todos los GGUFs generados antes de este cambio deben regenerarse para garantizar la compatibilidad con la nueva arquitectura y la lógica de conversión.