Proyek llama.cpp memperkenalkan dukungan untuk arsitektur Granite-Switch, varian model padat yang menampilkan N adapter LoRA tertanam yang dipilih per-token melalui token kontrol. Implementasi ini menggantikan indeks lengket global proof-of-concept sebelumnya dengan mekanisme perhatian "router" kausal dalam grafik untuk menyelesaikan indeks adapter.
- Router baru menggunakan lapisan perhatian kausal single-head untuk memulihkan indeks adapter di dalam grafik, memperbaiki masalah konkurensi di mana beberapa urutan sebelumnya membocorkan keadaan adapter satu sama lain.
- Dengan menyimpan kunci dan nilai router di cache KV per-urutan, permintaan konkuren kini terisolasi tanpa memerlukan manajemen keadaan global.
- Arsitektur ini mendukung pengalihan di tengah urutan, memungkinkan aktivasi adapter berbeda untuk tugas-tugas tertentu seperti kemampuan menjawab atau penulisan ulang kueri dalam satu urutan.
- Keterbatasan yang diketahui tetap ada: setelah sebuah adapter aktif dalam suatu urutan, ia tetap aktif hingga akhir urutan, karena gain router bersifat datar dan tidak memiliki bias kembaruan.
Perubahan ini memungkinkan inferensi multi-tugas yang efisien di CPU dengan beralih secara dinamis antar adapter khusus tanpa memuat ulang model, sambil mempertahankan isolasi untuk permintaan batch konkuren.