Proyek llama.cpp merilis versi b10833, memperkenalkan optimasi backend Vulkan yang menyatukan operasi normalisasi tertentu untuk meningkatkan kinerja inferensi.
- Dukungan untuk fusi RMS_NORM + MUL + ADD (+ MUL) dan RMS_NORM + VIEW + SET_ROWS di backend Vulkan.
- Ekstensi ROPE + VIEW + SET_ROWS untuk mendukung IMROPE.
- Penulis melaporkan peningkatan kinerja sekitar 4% pada model gemma4 di sistem mereka.
Pembaruan ini memberikan kecepatan inferensi yang lebih cepat kepada pengguna untuk model kompatibel yang berjalan pada perangkat keras yang kompatibel dengan Vulkan.