llama.cpp 프로젝트는 qwen4exp 아키텍처 지원의 중대한 버그를 해결한 빌드 b10737를 출시했습니다. 이 업데이트는 시퀀스 상태 지속성 문제를 해결하고 모델 로딩 중 CUDA 중단 현상을 방지합니다.
- qwen4exp 모델의 저장/복원 왕복 과정에서 kvu NaN 붕괴를 수정하고 ext.x/ext.y 인덱서 캐시 데이터를 복원합니다.
- per_layer_token_embd 행 수 유도를 수정하고 PLE 순환 캐시 레이어에서 null 포인터 역참조를 거부합니다.
- 이전에는 실제 장치에서 NaN 로짓과 충돌을 유발했던 qwen4exp에 대한 -sm 텐서 플래그를 비활성화합니다.
- 함수 오버로딩 충돌을 해결하기 위해 seq_set를 seq_get_all로 이름 변경하고 상태 무결성을 검증하는 테스트를 추가합니다.
이러한 변경 사항을 통해 2D mrope 콘텐츠나 PLE 레이어 사용 시 특히 데이터 손상이나 런타임 오류 없이 qwen4exp 모델을 로드하고 저장할 수 있습니다.