Tencent 发布了 Simple Attention Sparsification (SAS) 检查点,用于在 Qwen3 模型中为每个查询学习排序和选择 KV 块。与蒸馏密集注意力分数的方法不同,SAS 向选定的块添加连续门控,从而实现使用语言建模损失的上下文排序端到端优化。

  • 此次发布包括适用于 Qwen3-4B、Qwen3-8B 和 Qwen3-14B 模型的 gate-router 检查点。
  • 这些仅是路由器权重,需要相应的公开 Qwen3 基础模型以及 SGLang 分支中的 seer_attn 后端。
  • 默认的 sparse-attention 设置使用 2,048 个 token 的解码预算,但可以在不重新训练的情况下使用 1,024、2,048 或 4,096 个 token 的预算来评估检查点。

这些检查点允许用户使用 seer_attn 后端为高效推理提供 OpenAI 兼容 API。