Proyek llama.cpp merilis versi b10431, yang memperkenalkan dukungan untuk rollback keadaan rekuren (RS) dalam operasi ggml_ssm_scan. Perubahan ini memungkinkan rollback RS untuk model Nemotron di backend CPU dan CUDA.

  • Implementasi awal rollback keadaan rekuren untuk Nemotron pada CPU dan CUDA.
  • Dukungan untuk K > 1 dalam ssm_scan di semua backend.
  • Penggantian deteksi CUDA statis dengan API fused_op runtime untuk memeriksa dukungan operasi.
  • Fallback ke CPU ketika backend tidak mendukung rollback SSM.
  • Penambahan test-backend-ops untuk CPU dan CUDA guna memverifikasi fungsionalitas.

Pembaruan ini memungkinkan pengguna menjalankan model Nemotron dengan kemampuan rollback keadaan rekuren pada konfigurasi perangkat keras yang didukung.