El proyecto llama.cpp ha añadido soporte para la arquitectura HrmTextForCausalLM, habilitando específicamente la inferencia para el modelo DFM Mimir 1B. Esta implementación introduce un nuevo escritor y cargador GGUF para manejar la estructura única del modelo, que ejecuta dos pilas de transformadores en un ciclo alternado sobre el mismo flujo de tokens.
- El proceso de conversión mapea las proyecciones gqkv fusionadas a q/k/v de llama.cpp más un tensor de puerta sigmoide separado.
- La caché KV maneja el aliasing de bloques para arquitecturas en bucle, manteniendo una entrada por pasada a través de 128 capas.
- La inferencia se verifica frente a las salidas de referencia de Hugging Face con resultados idénticos de argmax en 334 posiciones.
- La cuantización a q8_0 conserva el 95.8% de precisión top-1, con los errores restantes confinados dentro del top-5 de HF.
Esta adición permite a los usuarios ejecutar modelos HRM-text en hardware local, aunque viene con compensaciones significativas de rendimiento debido al diseño de la arquitectura.