Proyek llama.cpp merilis versi b10431, yang memperkenalkan dukungan untuk rollback keadaan rekuren (RS) dalam operasi ggml_ssm_scan. Perubahan ini memungkinkan rollback RS untuk model Nemotron di backend CPU dan CUDA.
- Implementasi awal rollback keadaan rekuren untuk Nemotron pada CPU dan CUDA.
- Dukungan untuk K > 1 dalam ssm_scan di semua backend.
- Penggantian deteksi CUDA statis dengan API fused_op runtime untuk memeriksa dukungan operasi.
- Fallback ke CPU ketika backend tidak mendukung rollback SSM.
- Penambahan test-backend-ops untuk CPU dan CUDA guna memverifikasi fungsionalitas.
Pembaruan ini memungkinkan pengguna menjalankan model Nemotron dengan kemampuan rollback keadaan rekuren pada konfigurasi perangkat keras yang didukung.