Проект llama.cpp добавил поддержку архитектуры HrmTextForCausalLM, что позволяет выполнять вывод для модели DFM Mimir 1B. Эта реализация включает новый писатель и загрузчик GGUF для обработки уникальной структуры модели, которая использует два стека трансформеров в чередующемся цикле над одним потоком токенов.
- Процесс конвертации отображает объединённые проекции gqkv на q/k/v из llama.cpp плюс отдельный тензор сигмоидального гейта.
- Кэш KV обрабатывает алиасинг блоков для циклических архитектур, сохраняя одну запись на проход через 128 слоёв.
- Вывод верифицируется по эталонным результатам Hugging Face с идентичными результатами argmax в 334 позициях.
- Квантование до q8_0 сохраняет точность top-1 на уровне 95,8%, при этом оставшиеся ошибки находятся в пределах топ-5 от HF.
Это дополнение позволяет пользователям запускать модели HRM-text на локальном оборудовании, хотя это сопровождается значительными компромиссами в производительности из-за конструкции архитектуры.