llama.cppプロジェクトは、HrmTextForCausalLMアーキテクチャのサポートを追加し、特にDFM Mimir 1Bモデルの推論を可能にしました。この実装は、同じトークンストリーム上で2つのトランスフォーマースタックを交互に実行するモデルのユニークな構造を処理するために、新しいGGUFライターとローダーを導入しています。
- 変換プロセスでは、融合されたgqkv射影をllama.cppのq/k/vおよび独立したシグモイドゲートテンソルにマッピングします。
- KVキャッシュはループ型アーキテクチャのためのブロックエイリアシングを処理し、128層全体でパスごとに1つのエントリを保持します。
- 推論は、334位置すべてでargmax結果が一致するHugging Faceの参照出力と比較して検証されています。
- q8_0への量子化ではトップ1精度が95.8%維持され、残りの誤差はHFのトップ5内に収まっています。
この追加により、ユーザーはローカルハードウェアでHRM-textモデルを実行できるようになりますが、アーキテクチャの設計により大きなパフォーマンスのトレードオフが生じます。