Модель Qwen-AgentWorld-35B-A3B демонстрирует высокую производительность в задачах программирования, с результатом 65,63% по оценке написания программного обеспечения и 65,92% по общему бенчмарку. Она превосходит Qwen3.5-35B-A3B и соперничает с более крупными моделями в задачах, связанных с агентами, при первом впечатлении отмечается превосходная точность в долгосрочных рабочих процессах агентов.
Qwen-AgentWorld-35B-A3B для программирования?
Локальные бенчмарки на RTX 3090 — Qwen3.6 27b против Ornith
Пользователь сравнил Qwen3.6 27b, Gemma4 26B A4B QAT и Ornith1.0 35B MoE с помощью фреймворка inspect-ai на RTX 3090 для оценки производительности локальных моделей. Тестирование выявило смешанные результаты по общим знаниям, grounding (привязке к контексту) и бенчмаркам программирования, при этом Qwen3.6 в целом лидировал по баллам, а Ornith показал сильные стороны в таких областях, как DROP.
GLM 5.2 Q1_S против Qwen 27B Q8: локальное сравнение LLM
Любительское сравнение на потребительском оборудовании показывает, что сильно квантованная GLM-5.2 (Q1_S) превосходит модель более высокого бита Qwen 3.6 27B (Q8) в сложной задаче программирования, несмотря на значительно более низкую скорость вывода.
Qwen3.6 27B локально против Opus 4.8: движок вокселей на чистом C без фреймворков
Эксперимент по сравнению поставил Claude Code на базе Opus 4.8 против локально запущенной модели Qwen3.6 27B для создания движка воксельного мира на чистом C без внешних фреймворков или библиотек.
Оценка LLM для обнаружения уязвимостей в веб-приложениях
Исследование оценивает шесть LLM на обнаружение реальных уязвимостей в веб-приложениях в плагинах WordPress, выявляя, что показатели обнаружения варьируются в зависимости от модели и дизайна запроса. Claude Opus 4.6 достиг наивысшего показателя обнаружения — 63%, в то время как Qwen 3.5 достиг лишь 35%, и ни одна модель не стабильно идентифицировала все базовые уязвимости на всех итерациях.
CORTIS: текстовое адаптация моделей речи
CORTIS позволяет голосовым агентам, ориентированным на задачи, генерировать структурированные речевые выходы путем тонкой настройки моделей речи с использованием только текстовой задачной поддержки. Он превосходит архитектуры ASR-LLM при ухудшении акустических характеристик, особенно в сохранении высокого уровня семантики задач, не требуя парных аннотаций речи и целей во время обучения.