Proyek llama.cpp merilis build b10353, yang menangani bug kritis dalam operasi ggml_roll pada backend CUDA dan Metal. Sebelumnya, tensor sumber yang dipermutasi (tidak kontinu) menghasilkan hasil yang salah secara diam-diam karena backend ini mengabaikan informasi stride.

  • Perbaikan menambahkan persyaratan sumber kontinu ke kedua kernel roll CUDA dan Metal, sesuai dengan perlindungan GGML_OP_ROPE yang ada.
  • Perubahan ini memastikan scheduler kembali ke implementasi CPU untuk input tidak kontinu, yang menangani strides dengan benar.
  • Kasus test_roll yang dipermutasi ditambahkan untuk memverifikasi perbaikan.

Pembaruan ini mencegah korupsi data pada model yang bergantung pada operasi ROLL dengan layout memori non-standar.