O projeto llama.cpp adicionou suporte à arquitetura HrmTextForCausalLM, permitindo especificamente a inferência para o modelo DFM Mimir 1B. Esta implementação introduz um novo gravador e carregador GGUF para lidar com a estrutura única do modelo, que executa duas pilhas de transformadores em um ciclo alternado sobre o mesmo fluxo de tokens.
- O processo de conversão mapeia projeções gqkv fundidas para q/k/v do llama.cpp mais um tensor de porta sigmoide separado.
- O cache KV lida com aliasing de blocos para arquiteturas em loop, mantendo uma entrada por passagem através de 128 camadas.
- A inferência é verificada contra saídas de referência do Hugging Face com resultados idênticos de argmax em 334 posições.
- A quantização para q8_0 retém 95,8% de precisão top-1, com erros restantes confinados dentro do top-5 do HF.
Esta adição permite que os usuários executem modelos HRM-text em hardware local, embora isso venha com trocas significativas de desempenho devido ao design da arquitetura.