Tencentは、Qwen3モデルの各クエリに対してKVブロックをランク付けおよび選択する方法を学習するSimple Attention Sparsification (SAS) チェックポイントをリリースしました。密集なアテンションスコアを蒸留する手法とは異なり、SASは選択されたブロックに連続ゲートを追加し、言語モデリング損失によるコンテキストランクのエンドツーエンド最適化を可能にします。
- リリースには、Qwen3-4B、Qwen3-8B、Qwen3-14Bモデル用のgate-routerチェックポイントが含まれます。
- これらはルーター専用の重みであり、対応する公開Qwen3ベースモデルとSGLangのフォーク内のseer_attnバックエンドが必要です。
- デフォルトのsparse-attention設定は2,048トークンのデコード予算を使用しますが、再学習なしで1,024、2,048、または4,096トークンの予算でチェックポイントを評価できます。
このチェックポイントにより、ユーザーは効率的な推論のためにseer_attnバックエンドを使用してOpenAI互換APIを提供することができます。