Проект llama.cpp выпустил версию b10431, которая внедряет поддержку отката рекуррентного состояния (RS) в операции ggml_ssm_scan. Это изменение позволяет выполнять откат RS для моделей Nemotron на бэкендах CPU и CUDA.

  • Первоначальная реализация отката рекуррентного состояния для Nemotron на CPU и CUDA.
  • Поддержка K > 1 в ssm_scan для всех бэкендов.
  • Замена статического определения CUDA на runtime fused_op API для проверки поддержки операций.
  • Возврат к CPU, если бэкенд не поддерживает откат SSM.
  • Добавление test-backend-ops как для CPU, так и для CUDA для проверки функциональности.

Это обновление позволяет пользователям запускать модели Nemotron с возможностями отката рекуррентного состояния на поддерживаемых конфигурациях оборудования.