Proyek llama.cpp merilis versi b10246, yang mencakup perbaikan untuk kinerja OpenCL pada konfigurasi model tertentu. Pembaruan ini mengatasi masalah di mana kondisi dimensi asli tidak cukup untuk menangani bobot besar.

  • Merutekan tensor lm_head q6_K besar ke GEMV datar alih-alih gemv_noshuffle.
  • Menambahkan kondisi ukuran langsung untuk mencegah perlambatan pada model seperti gemma-4 E2B, yang memiliki dimensi [1536, 262144].
  • Menyediakan biner untuk macOS (Apple Silicon dan Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA, Vulkan, OpenVINO, SYCL, HIP), dan openEuler.

Perubahan ini memastikan bahwa matriks bobot besar diproses secara efisien pada perangkat OpenCL tanpa memicu hambatan kinerja.