llama.cpp 프로젝트는 GLM5-Next 멀티 토큰 예측(MTP) 헤드에 대한 지원을 추가하여, 해당 아키텍처의 특정 요구사항을 처리하기 위해 새로운 그래프 구조를 구현했습니다. 이 업데이트에는 NextN 블록에 대한 최적화가 포함되어 있어, 헤드리스 순방향 전달 시 비활성 연산을 건너뛰고 숨겨진 행을 올바르게 추출할 수 있습니다.

  • GLM5-Next MTP 그래프는 투영 레이어를 통해 토큰을 임베딩하고 no_build 태그를 통해 트렁크 빌더를 재사용합니다.
  • 헤드리스 NextN 순방향 전달은 출력 행이 없을 때 쿼리 경로와 어텐션 본문을 건너뛰어, 4토큰 캐치업 커널 시간을 6.9 ms에서 2.9 ms로 줄입니다.
  • 수정 사항을 통해 마스킹 추출이 올바른 숨겨진 행을 게시하고 다른 시퀀스와 꼬리 셀을 공유하는 부분 순환 롤백을 거부합니다.
  • MTP 그래프는 이제 가지치기 대신 표준 헬퍼를 사용하여 행을 자르며, 이는 다른 MTP 그래프와 일치합니다.
  • GGUF 파일은 트렁크 또는 NextN 텐서만 포함되어 있어도 초안 모델로 로드할 수 있습니다.

이러한 변경 사항을 통해 llama.cpp는 순환 상태 관리의 정확성을 유지하면서 보조 생성을 위해 GLM5-Next를 효율적인 초안 모델로 실행할 수 있게 됩니다.