Обновленный бенчмарк локальных визуально-языковых моделей оценивает 23 модели по 30 изображениям с 3 тестами каждое, что в сумме составляет 2070 тестов и 60 до 70 часов инференса. Самой эффективной моделью является Qwen3.6 27B (nothink) на Q4 с оценкой 79.6, за ней следует Qwen3.5 4B (nothink) на Q4, а затем Qwen3-VL 8B на Q8. Ключевые выводы включают снижение производительности визуальных моделей при использовании режима мышления, низкую эффективность моделей с архитектурой MoE по сравнению с плотными моделями, а также отсутствие универсального улучшения результатов при квантовании на Q8.
Результаты и рекомендации по обновленному бенчмарку визуальных моделей
Qwen выпустил MoE на 35 миллиардов параметров для имитации среды агента
Qwen представил модель Qwen-AgentWorld-35B-A3B, MoE на 35 миллиардов параметров, при этом у неё около 3 миллиардов активных параметров на токен. Модель обучена на имитации ответов от MCP, терминала, программирования, Android, веб-интерфейсов и графических интерфейсов операционных систем путем предсказания следующих наблюдений после действий агента, что позволяет эффективно обучать агентов и имитировать среду без выполнения реальных инструментов.
Alibaba анонсировала Qwen 3.8 Max — модель с 2,4 трлн параметров и открытыми весами, которая выйдет на следующей неделе
Команда Qwen от Alibaba объявила о выпуске Qwen 3.8 Max, новой флагманской модели с 2,4 трлн параметров, ориентированной на программирование, долгосрочную автономную работу агентов и мультимодальное рассуждение. Компания подтвердила, что на следующей неделе будут выпущены версии с открытыми весами как для Qwen 3.8 Max, так и для более компактной модели Qwen 3.8-27B.
Qwen3.8-Max выполняет one-shot по 35 промптам, включая симуляцию разбитого аквариума
В статье отмечается производительность Qwen3.8-Max в контексте оценки one-shot, подчеркивая ее способность обрабатывать сложные физические симуляции.
Microsoft выпустила Mage-VL — потоковую мультимодельную модель с нативным кодеком
Microsoft выпустила Mage-VL, эффективную мультимодельную базовую модель на 4 млрд параметров для понимания изображений и видео, использующую подход с нативным кодеком для оптимизации визуальной обработки. Система разделяет видеопотоки на опорные (I) кадры и предсказанные (P) кадры, сохраняя только те патчи, которым кодек выделяет биты, что снижает потребление визуальных токенов более чем на 75%.
Выход Qwen3.8 с открытыми весами, CLI для Kimi Code, стек LLM от Netflix, программное обеспечение для чипов Alibaba
Alibaba объявила о выпуске модели Qwen3.8 с открытыми весами, содержащей 2,4 триллиона параметров, а также об открытии исходного кода стека программного обеспечения для своего ИИ-чипа Zhenwu, чтобы снизить зависимость от экосистемы CUDA от Nvidia.