Проект llama.cpp выпустил версию b10431, которая внедряет поддержку отката рекуррентного состояния (RS) в операции ggml_ssm_scan. Это изменение позволяет выполнять откат RS для моделей Nemotron на бэкендах CPU и CUDA.
- Первоначальная реализация отката рекуррентного состояния для Nemotron на CPU и CUDA.
- Поддержка K > 1 в ssm_scan для всех бэкендов.
- Замена статического определения CUDA на runtime fused_op API для проверки поддержки операций.
- Возврат к CPU, если бэкенд не поддерживает откат SSM.
- Добавление test-backend-ops как для CPU, так и для CUDA для проверки функциональности.
Это обновление позволяет пользователям запускать модели Nemotron с возможностями отката рекуррентного состояния на поддерживаемых конфигурациях оборудования.