Proyek llama.cpp telah mengonsolidasikan pola fusi operasi pada backend Metal-nya ke dalam satu tabel, yang dibagikan oleh pengoptimal grafik dan encoder op. Perubahan ini juga memperbaiki bug pada indeks output absolut yang menyebabkan regresi kecepatan generasi token sebesar ~5%.
- Semua pola op yang dapat difusi kini dideklarasikan sekali di ggml-metal-fuse.cpp, memastikan konsistensi antara fase optimasi dan komputasi.
- Perbaikan untuk indeks node grafik absolut mencegah node terakhir dari pola fusi diperiksa secara keliru melalui pemeriksaan hitungan penggunaan, sehingga memulihkan fusi norm/MUL.
- Dukungan baru memungkinkan kernel gating_delta_net untuk berfusi dengan operasi salin cache, menulis snapshot langsung ke buffer KV cache.
- Flag fusi 'raw' telah diubah menjadi 'unsafe' untuk memperjelas bahwa callback spesifik pola berfungsi sebagai validator keamanan satu-satunya.
- API ad-hoc baru menyediakan statistik fusi yang tidak bergantung pada backend untuk pengujian, termasuk suite uji regresi yang membandingkan logit terfusi dan tidak terfusi melalui NMSE.
Pembaruan ini meningkatkan keterawatan kode dengan menyatukan logika fusi dan memulihkan kehilangan performa yang disebabkan oleh kegagalan fusi diam-diam pada versi sebelumnya.