llama.cpp 프로젝트는 ggml_ssm_scan 연산에서 재귀 상태(RS) 롤백 지원을 도입한 버전 b10431을 출시했습니다. 이 변경으로 CPU 및 CUDA 백엔드에서 Nemotron 모델의 RS 롤백이 가능해집니다.

  • CPU 및 CUDA에서 Nemotron에 대한 재귀 상태 롤백의 초기 구현.
  • 모든 백엔드에서 ssm_scan 내 K > 1 지원.
  • 연산 지원을 확인하기 위해 정적 CUDA 감지를 런타임 fused_op API로 교체.
  • 백엔드가 SSM 롤백을 지원하지 않을 때 CPU로 폴백.
  • 기능 검증을 위해 CPU 및 CUDA 모두에 test-backend-ops 추가.

이 업데이트를 통해 사용자는 지원되는 하드웨어 구성에서 재귀 상태 롤백 기능이 있는 Nemotron 모델을 실행할 수 있습니다.