O projeto llama.cpp lançou a versão b10437, que introduz suporte nativo para os modelos de linguagem causal MiniMax-Text-01 e MiniMax-M1. Esta atualização inclui os scripts de conversão necessários, modelos de chat e implementações da arquitetura do modelo para executar esses modelos específicos dentro do framework llama.cpp.
- Adicionado suporte a `MiniMaxText01ForCausalLM` e `MiniMaxM1ForCausalLM` na camada do modelo.
- Implementada supressão de tokens para embeddings com valores zero para evitar interrupção no processo de amostragem.
- Desempenho otimizado removendo operações de transposição de estado e usando funções comuns para uma implementação concisa.
- Adicionado um modelo de chat Jinja especificamente para o MiniMax-M1.
- Incluídos artefatos de build para macOS, Linux, Windows, Android e openEuler em CPU, GPU e vários aceleradores.
Este lançamento permite que os usuários executem localmente modelos MiniMax usando a infraestrutura de inferência existente do llama.cpp.