Команда Qwen выпустила модель Qwen3.8-Flash-Next, которая теперь доступна на ModelScope.
Это обновление представляет новый вариант в серии Qwen3.8-Flash.
Команда Qwen выпустила модель Qwen3.8-Flash-Next, которая теперь доступна на ModelScope.
Это обновление представляет новый вариант в серии Qwen3.8-Flash.
Ant Group открыла исходный код Ling-3.0-flash-Fin, первой модели семейства Ant Ling с улучшенными финансовыми возможностями, разработанной совместно с ведущими финансовыми учреждениями и экспертами в этой области.
Alibaba выпустила обновленную версию своей большой языковой модели Qwen3.8-Max-0902. Новая модель имеет 2,4 триллиона параметров и поддерживает контекстное окно объемом 1 миллион токенов.
В новостях ИИ этой недели выделены значимые выпуски моделей с открытым весом от Z.ai, Tencent и Alibaba, а также разработки в области инфраструктуры вывода и бенчмарков для агентов.
Команда Qwen от Alibaba выпустила Qwen3.8-Flash-Next, мультимодельную модель Mixture-of-Experts с открытыми весами, предназначенную для демонстрации архитектуры будущей серии Qwen4. Чекпоинт сочетает в себе базовую модель на 125B параметров, таблицу N-граммных эмбеддингов на 51B и модуль многозадачного предсказания токенов на 4B, активируя лишь 6B параметров на каждый токен.
Авторы представляют Quantization-Aware Healing (QAH), конвейер, который дистиллирует студентов 4-битных моделей непосредственно из несжатых моделей для восстановления производительности, потерянной во время структурного сжатия и квантования. Примененный к GPT-OSS 120B, этот метод производит Hypernova-60B, который соответствует или превосходит источник bfloat16 на 7 из 9 бенчмарков, используя примерно в 4 раза меньше памяти весов.
Мы используем cookie для аналитики и улучшения сайта. Вы можете принять или отклонить аналитические cookie. Политика конфиденциальности