Rilis llama.cpp b10858 memperkenalkan penggabungan kernel Vulkan untuk aktivasi UNARY berdekatan (GELU, SIGMOID, SILU, SOFTPLUS) dan operasi MUL. Optimisasi ini memulihkan regresi kecepatan pemrosesan prompt sebesar 10-18% dengan menghilangkan akses memori yang redundan dan percabangan runtime.

  • Pipelines yang digabungkan menangani GELU, SIGMOID, SILU, dan SOFTPLUS dengan MUL, menggunakan shader SPIR-V khusus untuk f32 dan f16.
  • Pengoptimal grafik sekarang menjadwalkan pasangan yang digabungkan bahkan ketika dipisahkan oleh node tanpa komputasi seperti VIEW atau RESHAPE, memperluas dukungan ke pola yang ditemukan dalam model seperti Gemma4.
  • Dukungan untuk penggabungan OP-on-B memungkinkan aktivasi pada operand MUL yang lebih kecil, memungkinkan gating yang efisien dalam arsitektur shared-expert.
  • Uji backend mencakup tata letak baru termasuk 'gate' dan 'view_mid' untuk memvalidasi kebenaran di berbagai bentuk tensor.

Perubahan ini secara signifikan meningkatkan latensi inferensi untuk model yang sangat bergantung pada mekanisme gating aktivasi dengan mengurangi overhead komputasi di backend Vulkan.