Proyek llama.cpp telah memperbarui backend OpenCL-nya untuk meningkatkan kinerja perkalian matriks pada dua generasi GPU Adreno. Perubahan ini terutama menargetkan generasi X2E dengan secara default menggunakan jalur GEMM xmem F16xF32 dan mengoptimalkan penanganan untuk generasi A7X.

  • Mengaktifkan secara default GEMM xmem F16xF32 Adreno untuk perangkat X2E, yang sebelumnya memerlukan variabel lingkungan opt-in.
  • Melewati GEMM tiled f32 pada kompiler Adreno A7X dengan mengalihkan operasi batched ke kernel per-baris untuk menghindari masalah spilling register.
  • Optimasi xmem memberikan percepatan prefill sekitar 25% pada gpt-oss-20b untuk perangkat Adreno X2-90, sementara bypass A7X menghasilkan peningkatan sekitar 9% pada gemma-3n-E4B.

Optimasi ini mengatasi inefisiensi kompiler spesifik pada silikon Adreno lama dan baru, mengurangi waktu GPU yang dihabiskan dalam kernel matmul lambat selama fase prefill model.