A Tencent lançou checkpoints de Simple Attention Sparsification (SAS) que aprendem a classificar e selecionar blocos KV para cada consulta nos modelos Qwen3. Diferente de métodos que destilam pontuações de atenção densa, o SAS adiciona portas contínuas aos blocos selecionados, permitindo a otimização de ponta a ponta do ranking de contexto com a perda de modelagem da linguagem.
- O lançamento inclui checkpoints gate-router para os modelos Qwen3-4B, Qwen3-8B e Qwen3-14B.
- Estes são pesos apenas de roteador que requerem um modelo base Qwen3 público correspondente e o backend seer_attn em um fork do SGLang.
- A configuração padrão de sparse-attention usa um orçamento de decodificação de 2.048 tokens, mas os checkpoints podem ser avaliados com orçamentos de 1.024, 2.048 ou 4.096 tokens sem retreinamento.
Os checkpoints permitem que os usuários sirvam uma API compatível com OpenAI usando o backend seer_attn para inferência eficiente.