llama.cpp 项目已新增对 HrmTextForCausalLM 架构的支持,专门启用 DFM Mimir 1B 模型的推理。该实现引入了新的 GGUF 写入器和加载器,以处理模型独特的结构,该结构在相同的 token 流上交替运行两个 transformer 堆栈。
- 转换过程将融合的 gqkv 投影映射到 llama.cpp 的 q/k/v 以及一个独立的 sigmoid 门控张量。
- KV 缓存为循环架构处理块别名,在 128 层中每轮保留一个条目。
- 推理结果与 Hugging Face 参考输出进行验证,在 334 个位置上 argmax 结果完全一致。
- 量化至 q8_0 保留了 95.8% 的 top-1 准确率,剩余误差限制在 HF top-5 范围内。
此新增功能允许用户在本地硬件上运行 HRM-text 模型,但由于架构设计的原因,会带来显著的性能权衡。