Proyek llama.cpp merilis build b11266, yang mencakup optimasi Vulkan yang memuat matriks A F32 dua elemen sekaligus ketika mereka sejajar 2. Perubahan ini mengatasi masalah kinerja pada perangkat keras Intel di mana memuat float satu per satu tidak efisien, dan juga memperbaiki validasi yang hilang untuk penjajaran `a_offset` dalam patch asli.
- Modifikasi ini memanfaatkan logika pemuatan 2-sejajar yang ada di `mul_mat_vec` untuk meningkatkan throughput pada arsitektur Intel BMG.
- Hasil benchmark pada Intel B60 menunjukkan percepatan signifikan untuk bentuk perkalian matriks tertentu, dengan kinerja meningkat dari 153.08 GFLOPS menjadi 221.66 GFLOPS untuk satu kasus uji dan hingga 1.63 TFLOPS untuk kasus lainnya.
- Rilis ini menyediakan biner untuk macOS (Apple Silicon dan Intel), Linux (CPU, Vulkan, CUDA, ROCm, OpenVINO, SYCL, Snapdragon), Android, Windows, dan openEuler.
Pembaruan ini meningkatkan kinerja inferensi pada GPU Intel menggunakan backend Vulkan dengan mengoptimalkan pola akses memori untuk operasi matriks titik mengambang.