Proyek llama.cpp telah merilis versi b10330, memperkenalkan optimasi CUDA yang menggabungkan operasi rms_norm, perkalian, dan RoPE menjadi satu kernel. Perubahan ini disertai dengan pemeriksaan rentang memori untuk operasi yang digabungkan dan kasus uji baru untuk bobot broadcast.
- CUDA: gabungkan rms_norm + mul + rope (+ view + set_rows)
- tests: tambahkan kasus bobot broadcast ke rms_norm_mul_rope
- CUDA: periksa rentang memori sebelum penggabungan rms_norm rope
- CUDA: periksa rentang memori dalam penggabungan set_rows rope
Rilis ini menyediakan biner untuk macOS, Linux, Windows, Android, dan iOS di berbagai backend perangkat keras, termasuk CPU, Vulkan, ROCm, OpenVINO, SYCL, dan HIP.