O projeto llama.cpp adicionou suporte inicial para a arquitetura do modelo GLM-5.3-Flash (GLM5-Next), incluindo migração para memória de índice híbrido e capacidades iniciais de Multi-Token Prediction (MTP).

  • Suporte inicial ao MTP foi adicionado, embora removido no pull request inicial para permitir uma revisão focada.
  • O layout do k-pool agora é mantido entre ubatches para evitar desatualização após edições de sequência e desmontagens compartilhadas.
  • Checkpoints de rollback recorrente são escritos corretamente para o estado conv e o estado delta net.
  • Um bug no stride do stream build_attn_mha foi corrigido para consultas não contíguas, garantindo o prefill multi-stream correto para GLM5-Next.
  • Os filtros de proteção de quantização foram limpos para remover entradas duplicadas.

Essas alterações garantem inferência estável e gerenciamento correto de estado para modelos GLM5-Next em vários backends de hardware, incluindo CUDA, ROCm e CPU.