llama.cpp 프로젝트는 하이브리드 인덱스 메모리로의 마이그레이션 및 초기 Multi-Token Prediction (MTP) 기능을 포함하여 GLM-5.3-Flash (GLM5-Next) 모델 아키텍처에 대한 초기 지원을 추가했습니다.

  • 초기 MTP 지원이 추가되었으나, 집중적인 검토를 허용하기 위해 초기 풀 리퀘스트에서는 제외되었습니다.
  • k-pool 레이아웃은 시퀀스 편집 및 공유 teardown 후 구식화를 방지하기 위해 ubatch 간에 유지됩니다.
  • 순환 롤백 체크포인트가 conv 상태 및 delta net 상태에 대해 올바르게 작성됩니다.
  • 비연속 쿼리에 대한 build_attn_mha 스트림 스트라이드의 버그가 수정되어 GLM5-Next에 대한 올바른 멀티스트림 프리필이 보장됩니다.
  • 양자화 보호 필터가 정리되어 중복 항목이 제거되었습니다.

이러한 변경은 CUDA, ROCm 및 CPU를 포함한 다양한 하드웨어 백엔드에서 GLM5-Next 모델의 안정적인 추론과 올바른 상태 관리를 보장합니다.