Tencent telah merilis checkpoint Simple Attention Sparsification (SAS) yang belajar meranking dan memilih blok KV untuk setiap kueri dalam model Qwen3. Berbeda dengan metode yang mendistilasi skor perhatian padat, SAS menambahkan gerbang kontinu ke blok yang dipilih, memungkinkan optimisasi end-to-end dari perankingan konteks dengan kerugian pemodelan bahasa.
- Rilis ini mencakup checkpoint gate-router untuk model Qwen3-4B, Qwen3-8B, dan Qwen3-14B.
- Ini adalah bobot router-only yang memerlukan model dasar Qwen3 publik yang sesuai dan backend seer_attn di fork SGLang.
- Pengaturan sparse-attention default menggunakan anggaran decode 2.048 token, tetapi checkpoint dapat dievaluasi dengan anggaran 1.024, 2.048, atau 4.096 token tanpa pelatihan ulang.
Checkpoint memungkinkan pengguna melayani API yang kompatibel dengan OpenAI menggunakan backend seer_attn untuk inferensi yang efisien.