Tencentは、Qwen3モデルの各クエリに対してKVブロックをランク付けおよび選択する方法を学習するSimple Attention Sparsification (SAS) チェックポイントをリリースしました。密集なアテンションスコアを蒸留する手法とは異なり、SASは選択されたブロックに連続ゲートを追加し、言語モデリング損失によるコンテキストランクのエンドツーエンド最適化を可能にします。

  • リリースには、Qwen3-4B、Qwen3-8B、Qwen3-14Bモデル用のgate-routerチェックポイントが含まれます。
  • これらはルーター専用の重みであり、対応する公開Qwen3ベースモデルとSGLangのフォーク内のseer_attnバックエンドが必要です。
  • デフォルトのsparse-attention設定は2,048トークンのデコード予算を使用しますが、再学習なしで1,024、2,048、または4,096トークンの予算でチェックポイントを評価できます。

このチェックポイントにより、ユーザーは効率的な推論のためにseer_attnバックエンドを使用してOpenAI互換APIを提供することができます。