O projeto llama.cpp lançou a compilação b10701, que inclui uma correção para os modelos rascunho DFlash2 NVFP4. A atualização aborda um problema em que esses modelos produziam quase nenhum token especulativo aceito.

  • Passa as escalas NVFP4 ausentes para as operações de atenção no pull request #28000.
  • Garante que as escalas de projeção Q, K, V e de saída sejam passadas corretamente para as operações de grafo correspondentes.

Esta alteração restaura a funcionalidade adequada para os modelos DFlash2 NVFP4 corrigindo a propagação de escalas necessária para a decodificação especulativa.