Tencent ने Simple Attention Sparsification (SAS) चेकपॉइंट जारी किए हैं जो Qwen3 मॉडल में प्रत्येक क्वेरी के लिए KV ब्लॉकों को रैंक करने और चुनने का सीखते हैं। घनी एटेंशन स्कोर को डिस्टिल करने वाले विधियों के विपरीत, SAS चयनित ब्लॉकों में निरंतर गेट्स जोड़ता है, जिससे भाषा-मॉडलिंग नुकसान के साथ संदर्भ रैंकिंग का एंड-टू-एंड अनुकूलन संभव होता है।

  • इस रिलीज़ में Qwen3-4B, Qwen3-8B और Qwen3-14B मॉडल के लिए gate-router चेकपॉइंट शामिल हैं।
  • ये केवल राउटर वजन हैं जिन्हें एक संगत सार्वजनिक Qwen3 बेस मॉडल और SGLang के फ़र्क में seer_attn बैकएंड की आवश्यकता होती है।
  • डिफ़ॉल्ट sparse-attention सेटअप 2,048-टोकन डिकोड बजट का उपयोग करता है, लेकिन चेकपॉइंट को रीट्रेनिंग के बिना 1,024, 2,048 या 4,096-टोकन बजट के साथ मूल्यांकित किया जा सकता है।

चेकपॉइंट उपयोगकर्ताओं को कुशल इनफरेंस के लिए seer_attn बैकएंड का उपयोग करके एक OpenAI-अनुकूल API प्रदान करने की अनुमति देते हैं।