Tencent выпустила чекпоинты Simple Attention Sparsification (SAS), которые учатся ранжировать и выбирать KV-блоки для каждого запроса в моделях Qwen3. В отличие от методов, дистиллирующих плотные оценки внимания, SAS добавляет непрерывные гейты к выбранным блокам, что позволяет проводить сквозную оптимизацию ранжирования контекста с использованием функции потерь языкового моделирования.
- В релиз входят чекпоинты gate-router для моделей Qwen3-4B, Qwen3-8B и Qwen3-14B.
- Это веса только маршрутизатора, требующие соответствующей базовой модели Qwen3 с открытым исходным кодом и бэкенда seer_attn во форке SGLang.
- Настройка sparse-attention по умолчанию использует бюджет декодирования в 2048 токенов, но чекпоинты можно оценивать с бюджетами в 1024, 2048 или 4096 токенов без повторного обучения.
Чекпоинты позволяют пользователям обслуживать API, совместимый с OpenAI, используя бэкенд seer_attn для эффективного вывода.