Proyek llama.cpp merilis build b11009, yang mengatasi masalah kritis dengan keadaan terbelah dan perhitungan granularitas untuk lapisan perhatian QKV yang digabungkan.
- Kode model sekarang menghitung keadaan terbelah untuk attn_qkv berdasarkan n_head * n_embd_head_k, menyelesaikan masalah kompatibilitas dengan model gemma4 yang menggunakan flag --fuse-qkv di mana n_embd adalah 5376 tetapi Q adalah 8192.
- Dukungan untuk lapisan perhatian penuh yang digabungkan telah ditambahkan untuk arsitektur qwen35 dan qwen35moe.
- Tag TODO [TAG_SPLIT_QGATE_QWEN] ditambahkan untuk melacak pekerjaan lebih lanjut pada pembagian QGate untuk model Qwen.
Rilis ini memastikan bahwa konfigurasi model tertentu, khususnya yang melibatkan operasi QKV yang digabungkan di gemma4 dan qwen35, berfungsi dengan benar tanpa kesalahan perhitungan keadaan.