O projeto llama.cpp adicionou suporte à cabeça de previsão multi-tokeno (MTP) do GLM5-Next, implementando uma nova estrutura de gráfico para atender às suas necessidades arquitetônicas específicas. Esta atualização inclui otimizações para o bloco NextN, permitindo que ele pule computação inativa durante encaminhamentos sem saída e extraia corretamente as linhas ocultas.

  • O gráfico MTP do GLM5-Next incorpora tokens por meio de camadas de projeção e reutiliza construtores de tronco por meio da tag no_build.
  • Encaminhamentos NextN sem saída agora pulam caminhos de consulta e corpos de atenção quando não há linhas de saída, reduzindo o tempo do kernel de recuperação de 4 tokenos de 6,9 ms para 2,9 ms.
  • Correções garantem que a extração mascarada publique as linhas ocultas corretas e rejeite retrocessos recorrentes parciais que compartilham células finais com outras sequências.
  • O gráfico MTP agora corta linhas usando auxiliares padrão em vez de poda, alinhando-se com outros gráficos MTP.
  • Arquivos GGUF agora podem ser carregados como modelos rascunho mesmo que contenham apenas tensores de tronco ou NextN.

Essas alterações permitem que o llama.cpp execute eficientemente o GLM5-Next como um modelo rascunho para geração assistida, mantendo a correção no gerenciamento do estado recorrente.