O projeto llama.cpp lançou a versão b10431, que introduz suporte para rollback de estado recorrente (RS) na operação ggml_ssm_scan. Esta alteração permite o rollback de RS para modelos Nemotron nos backends de CPU e CUDA.

  • Implementação inicial do rollback de estado recorrente para Nemotron em CPU e CUDA.
  • Suporte para K > 1 em ssm_scan em todos os backends.
  • Substituição da detecção estática de CUDA por uma API fused_op em tempo de execução para verificar o suporte de operações.
  • Fallback para CPU quando o backend não suporta rollback de SSM.
  • Adição de test-backend-ops tanto para CPU quanto para CUDA para verificar a funcionalidade.

Esta atualização permite que os usuários executem modelos Nemotron com capacidades de rollback de estado recorrente em configurações de hardware compatíveis.