Le projet llama.cpp a ajouté la prise en charge de l'architecture HrmTextForCausalLM, permettant spécifiquement l'inférence pour le modèle DFM Mimir 1B. Cette implémentation introduit un nouveau writer et loader GGUF pour gérer la structure unique du modèle, qui fait tourner deux piles de transformateurs en cycle alterné sur le même flux de tokens.

  • Le processus de conversion mappe les projections gqkv fusionnées vers q/k/v de llama.cpp plus un tenseur de porte sigmoid séparé.
  • Le cache KV gère l'aliasing de bloc pour les architectures en boucle, maintenant une entrée par passage sur 128 couches.
  • L'inférence est vérifiée par rapport aux sorties de référence Hugging Face avec des résultats argmax identiques sur 334 positions.
  • La quantisation en q8_0 conserve 95,8 % de précision top-1, les erreurs restantes étant confinées dans le top-5 HF.

Cette ajout permet aux utilisateurs d'exécuter des modèles HRM-text sur du matériel local, bien que cela s'accompagne de compromis de performance significatifs dus à la conception de l'architecture.