llama.cpp 프로젝트는 DFM Mimir 1B 모델의 추론을 가능하게 하는 HrmTextForCausalLM 아키텍처에 대한 지원을 추가했습니다. 이 구현은 동일한 토큰 스트림에서 두 개의 트랜스포머 스택을 교대로 실행하는 모델의 고유한 구조를 처리하기 위해 새로운 GGUF 작성기 및 로더를 도입합니다.

  • 변환 과정은 결합된 gqkv 프로젝션을 llama.cpp의 q/k/v와 별도의 시그모이드 게이트 텐서로 매핑합니다.
  • KV 캐시는 루프된 아키텍처에 대한 블록 별칭을 처리하며, 128개 레이어에 걸쳐 한 번의 통과당 하나의 엔트리를 유지합니다.
  • 추론은 Hugging Face 참조 출력과 비교 검증되었으며, 334개의 위치에서 동일한 argmax 결과를 보였습니다.
  • q8_0 양자화는 상위 1 정확도 95.8%를 유지하며, 나머지 오류는 HF 상위 5 이내로 제한됩니다.

이 추가 기능으로 사용자는 로컬 하드웨어에서 HRM-text 모델을 실행할 수 있지만, 아키텍처 설계로 인해 상당한 성능 트레이드오프가 발생합니다.