Proyek llama.cpp telah menambahkan dukungan untuk arsitektur HrmTextForCausalLM, khususnya memungkinkan inferensi untuk model DFM Mimir 1B. Implementasi ini memperkenalkan penulis dan pemuat GGUF baru untuk menangani struktur unik model tersebut, yang menjalankan dua tumpukan transformer secara bergantian dalam siklus atas aliran token yang sama.
- Proses konversi memetakan proyeksi gqkv yang digabungkan ke q/k/v llama.cpp ditambah tensor gerbang sigmoid terpisah.
- Cache KV menangani aliasing blok untuk arsitektur berlapis, menyimpan satu entri per putaran di seluruh 128 lapisan.
- Inferensi diverifikasi terhadap keluaran referensi Hugging Face dengan hasil argmax identik di 334 posisi.
- Kuantisasi ke q8_0 mempertahankan akurasi top-1 sebesar 95.8%, dengan sisa kesalahan terbatas dalam top-5 HF.
Penambahan ini memungkinkan pengguna menjalankan model HRM-text pada perangkat keras lokal, meskipun hal ini disertai dengan pengorbanan kinerja yang signifikan karena desain arsitekturnya.