llama.cpp 프로젝트는 Multi-Token Prediction (MTP) 텐서를 실제로 사용할 때만 로드하는 변경 사항을 포함한 버전 b10212를 출시했습니다. 이 업데이트는 기능을 지원하지만 필요하지 않은 나머지 모델의 로드 중에 MTP 텐서가 건너뛰어지도록 보장합니다.

  • 사용 여부에 따라 MTP 텐서를 조건부로 로드합니다.
  • 필요 없는 지원 모델에서 MTP 로드를 건너뜁니다.

이 최적화는 Multi-Token Prediction을 사용하지 않는 모델의 불필요한 메모리 오버헤드를 줄입니다.