Proyek llama.cpp merilis build b10353, yang menangani bug kritis dalam operasi ggml_roll pada backend CUDA dan Metal. Sebelumnya, tensor sumber yang dipermutasi (tidak kontinu) menghasilkan hasil yang salah secara diam-diam karena backend ini mengabaikan informasi stride.
- Perbaikan menambahkan persyaratan sumber kontinu ke kedua kernel roll CUDA dan Metal, sesuai dengan perlindungan GGML_OP_ROPE yang ada.
- Perubahan ini memastikan scheduler kembali ke implementasi CPU untuk input tidak kontinu, yang menangani strides dengan benar.
- Kasus test_roll yang dipermutasi ditambahkan untuk memverifikasi perbaikan.
Pembaruan ini mencegah korupsi data pada model yang bergantung pada operasi ROLL dengan layout memori non-standar.