Proyek llama.cpp merilis build b10069, yang mencakup pembaruan OpenCL spesifik untuk GPU Qualcomm Adreno. Perubahan utama melibatkan dukungan operasi broadcast untuk kernel Adreno MUL_MAT dan menghormati offset tampilan untuk varian Q8_0 MUL_MAT untuk mengaktifkan fungsionalitas multi-stream di llama-server.
- Menambahkan dukungan broadcast untuk kernel GEMM/GEMV noshuffle Adreno.
- Memastikan offset tampilan ditangani dengan benar untuk operasi GEMM/GEMV noshuffle Adreno.
- Mengimplementasikan dukungan broadcast GEMM/GEMV umum di dalam backend OpenCL.
- Menghapus tes dan komentar yang tidak perlu dari basis kode.
Pembaruan ini meningkatkan kompatibilitas dengan beban kerja multi-stream pada perangkat keras Adreno dengan memperbaiki masalah penanganan kernel yang kritis.