Tencent은 Qwen3 모델의 각 쿼리에 대해 KV 블록을 순위 매기고 선택하는 방법을 학습하는 Simple Attention Sparsification (SAS) 체크포인트를 출시했습니다. 밀집 어텐션 점수를 증류하는 방법과 달리 SAS는 선택된 블록에 연속 게이트를 추가하여 언어 모델링 손실로 컨텍스트 랭킹의 엔드투엔드 최적화를 가능하게 합니다.
- 이번 릴리스에는 Qwen3-4B, Qwen3-8B 및 Qwen3-14B 모델용 gate-router 체크포인트가 포함됩니다.
- 이들은 해당 공개 Qwen3 기본 모델과 SGLang 포크의 seer_attn 백엔드가 필요한 라우터 전용 가중치입니다.
- 기본 sparse-attention 설정은 2,048토큰 디코드 예산을 사용하지만, 재학습 없이 1,024, 2,048 또는 4,096토큰 예산으로 체크포인트를 평가할 수 있습니다.
체크포인트를 사용하면 사용자는 효율적인 추론을 위해 seer_attn 백엔드를 사용하여 OpenAI 호환 API를 제공할 수 있습니다.