Tencent a publié des checkpoints de Simple Attention Sparsification (SAS) qui apprennent à classer et sélectionner des blocs KV pour chaque requête dans les modèles Qwen3. Contrairement aux méthodes qui distillent les scores d'attention dense, SAS ajoute des portes continues aux blocs sélectionnés, permettant l'optimisation de bout en bout du classement du contexte avec la perte de modélisation du langage.
- La publication inclut des checkpoints gate-router pour les modèles Qwen3-4B, Qwen3-8B et Qwen3-14B.
- Ce sont des poids uniquement de routeur qui nécessitent un modèle de base Qwen3 public correspondant et le backend seer_attn dans un fork de SGLang.
- La configuration par défaut de sparse-attention utilise un budget de décodage de 2 048 tokens, mais les checkpoints peuvent être évalués avec des budgets de 1 024, 2 048 ou 4 096 tokens sans réentraînement.
Les checkpoints permettent aux utilisateurs de servir une API compatible OpenAI en utilisant le backend seer_attn pour une inférence efficace.