llama.cpp 프로젝트가 Qwen4exp 모델 아키텍처에 대한 최적화를 포함한 빌드 b10730을 출시했습니다. 주요 변경 사항은 전치 및 sum_rows 연산을 사용하는 대신 인덱서 헤드를 슬라이스별로 합산하여 메모리 복사 오버헤드를 줄이는 것입니다.
- Qwen3.8-Flash-Next UD-Q4_K_XL을 사용한 RTX PRO 6000에서 프롬프트 처리 속도가 초당 2170개 토큰에서 2366개 토큰으로 증가했습니다.
- 이 최적화는 rope가 새로 할당된 연속 텐서를 반환하므로 인덱서 쿼리에 대한 불필요한 연속 텐서 요구사항을 제거합니다.
- 생성 속도는 영향을 받지 않지만, 프롬프트 처리의 이득은 컨텍스트 길이와 ubatch 크기에 따라 스케일링됩니다.
- 이전 버전과 비교했을 때 탐욕스러운 출력은 토큰 단위로 동일하게 유지됩니다.
이 업데이트는 프롬프트 처리 단계에서 계산 낭비를 줄임으로써 Qwen4exp 모델을 사용하는 긴 컨텍스트 추론 작업의 효율성을 향상시킵니다.