O projeto llama.cpp lançou a compilação b10142, que introduz suporte preliminar ao vision para o modelo MiniMax-M3. Esta atualização implementa uma versão apenas de texto que reutiliza componentes existentes do MiniMax-M2, incluindo GQA com QK-norm por cabeça e rotação parcial, especialistas no estilo DeepSeek-V3 e ativação swigluoai.
- A implementação inclui a torre vision do MiniMax-M3 (mmproj + grafo clip), enquanto remove os cabeçotes MTP e o suporte à atenção esparsa.
- As otimizações de desempenho incluem a decomposição de operações lentas da CPU em operações GPU/CPU para grandes ganhos de velocidade em contextos longos e a reescrita do operador do indexador para ser nativo CUDA.
- Um caminho unificado de 4 vias + decode reduz o número de nós por camada de ~50 para ~25, encolhendo os buffers de computação em aproximadamente 20%.
- Os efeitos medidos mostram que as velocidades de decode aumentam de 6,2–7,15 t/s para 7,7–7,8 t/s em configurações com offload de especialistas, tornando o prefill cerca de 10% mais rápido.
Todos os GGUFs gerados antes desta alteração devem ser regenerados para garantir a compatibilidade com a nova arquitetura e lógica de conversão.