Tencent ha lanzado checkpoints de Simple Attention Sparsification (SAS) que aprenden a clasificar y seleccionar bloques KV para cada consulta en los modelos Qwen3. A diferencia de los métodos que destilan puntuaciones de atención densa, SAS añade puertas continuas a los bloques seleccionados, permitiendo la optimización de extremo a extremo del ranking de contexto con la pérdida de modelado del lenguaje.

  • El lanzamiento incluye checkpoints gate-router para los modelos Qwen3-4B, Qwen3-8B y Qwen3-14B.
  • Estos son pesos solo de enrutador que requieren un modelo base Qwen3 público correspondiente y el backend seer_attn en un fork de SGLang.
  • La configuración predeterminada de sparse-attention utiliza un presupuesto de decodificación de 2,048 tokens, pero los checkpoints pueden evaluarse con presupuestos de 1,024, 2,048 o 4,096 tokens sin reentrenamiento.

Los checkpoints permiten a los usuarios servir una API compatible con OpenAI utilizando el backend seer_attn para inferencia eficiente.