Proyek llama.cpp merilis build b10069, yang mencakup pembaruan OpenCL spesifik untuk GPU Qualcomm Adreno. Perubahan utama melibatkan dukungan operasi broadcast untuk kernel Adreno MUL_MAT dan menghormati offset tampilan untuk varian Q8_0 MUL_MAT untuk mengaktifkan fungsionalitas multi-stream di llama-server.

  • Menambahkan dukungan broadcast untuk kernel GEMM/GEMV noshuffle Adreno.
  • Memastikan offset tampilan ditangani dengan benar untuk operasi GEMM/GEMV noshuffle Adreno.
  • Mengimplementasikan dukungan broadcast GEMM/GEMV umum di dalam backend OpenCL.
  • Menghapus tes dan komentar yang tidak perlu dari basis kode.

Pembaruan ini meningkatkan kompatibilitas dengan beban kerja multi-stream pada perangkat keras Adreno dengan memperbaiki masalah penanganan kernel yang kritis.