llama.cpp 프로젝트는 DFlash2 NVFP4 초안 모델에 대한 수정을 포함한 빌드 b10701을 출시했습니다. 이 업데이트는 이러한 모델이 거의 승인된 추측 토큰을 생성하지 않는 문제를 해결합니다.
- pull request #28000에서 어텐션 연산으로 누락된 NVFP4 스케일을 전달합니다.
- Q, K, V 및 출력 투영 스케일이 해당 그래프 연산에 올바르게 전달되도록 보장합니다.
이 변경은 추측 디코딩에 필요한 스케일 전파를 수정하여 DFlash2 NVFP4 모델의 적절한 기능을 복원합니다.