llama.cpp 프로젝트는 융합 QKV 어텐션 레이어의 분할 상태 및 세분성 계산과 관련된 중요한 문제를 해결하는 빌드 b11009을 출시했습니다.

  • 모델 코드는 이제 n_head * n_embd_head_k를 기반으로 attn_qkv에 대한 분할 상태를 올바르게 계산하여, n_embd가 5376이지만 Q가 8192인 --fuse-qkv 플래그를 사용하는 gemma4 모델과의 호환성 문제를 해결했습니다.
  • qwen35 및 qwen35moe 아키텍처에 대한 융합 풀 어텐션 레이어 지원이 추가되었습니다.
  • Qwen 모델의 QGate 분할에 대한 추가 작업을 추적하기 위해 TODO 태그 [TAG_SPLIT_QGATE_QWEN]가 추가되었습니다.

이 릴리스는 gemma4 및 qwen35의 융합 QKV 연산과 관련된 특정 모델 구성이 상태 계산 오류 없이 올바르게 작동함을 보장합니다.