Лаборатория · Zhipu AI
arxiv arXiv cs.CL · 9 д назад · 2 просмотра

OSReward представляет стандартизированную оценку моделей вознаграждения для кроссплатформенного использования компьютера

Исследователи представляют OSReward, реалистичный бенчмарк, предназначенный для оценки надежности моделей «визуальный язык» (VLM), выступающих в роли судей для траекторий агентов, использующих компьютер. Исследование показывает, что даже самые современные VLM страдают от систематической предвзятости к снисходительности и часто слишком дороги для масштабирования, тогда как доступные открытые модели работают плохо.

media TLDR AI · 11 д назад · 4 просмотра

xAI запускает Build Mode; исследователи призывают к соглашению о замедлении развития ИИ

xAI запустила «Build Mode» для подписчиков SuperGrok Heavy, позволяя пользователям создавать, редактировать, просматривать и публиковать веб-сайты, приложения, игры и панели мониторинга непосредственно из чата без предварительной настройки. Одновременно более тысячи сотрудников компаний, разрабатывающих передовой ИИ, подписали заявление с просьбой к правительству США поддержать международные усилия по разработке инструментов для целенаправленного замедления развития передового автоматизированного ИИ.

media AI News (smol.ai) · 11 д назад

Moonshot выпустила модель Kimi K3 с открытыми весами и инфраструктуру

Moonshot опубликовала полные детали, веса и сопутствующую инфраструктуру для Kimi K3 — модели Mixture-of-Experts на 2.8T параметров с примерно 104B активных параметров на токен. В релиз вошли технические отчеты, описывающие её гибридный стек длинного контекста, и новые инструменты, такие как MoonEP, FlashKDA и AgentEnv.

arxiv arXiv cs.CL · 12 д назад · 2 просмотра

PIVOT разделяет сканирование префиксов между группами запросов для ускорения разреженного внимания на уровне токенов

PIVOT (Proxy Indexing Via One full-prefix Traversal) — это решение без дообучения, заменяющее индексатор DeepSeek Sparse Attention (DSA), которое снижает вычислительную избыточность за счёт общего сканирования одного префикса для группы близких запросов. Вместо оценки каждого предыдущего токена для каждого запроса отдельно PIVOT объединяет группу в один прокси-запрос для получения набора кандидатов, из которых для каждого запроса выбираются топ-k токенов.

arxiv arXiv cs.CL · 12 д назад

Фреймворк Zing улучшает социальный интеллект больших языковых моделей с помощью бенчмарка SoMBench и заземления Actio

В докладе представлен Zing, интегрированный фреймворк, разработанный для повышения социального интеллекта больших языковых моделей путём измерения, интериоризации и заземления социальных способностей. Авторы представляют SoMBench — бенчмарк, основанный на психологии, охватывающий 17 вторичных измерений и 3481 экземпляр, верифицированных экспертами, который показывает, что текущие большие языковые модели имеют значительный потенциал для улучшения, ни одна из них не достигла производительности, близкой к максимальному пределу.

media MarkTechPost · 21 д назад SWE-bench Verified · 80.6% · 11 просмотров

Сравнение Kimi K3, DeepSeek V4 Pro и GLM-5.2 по бенчмаркам, лицензии и стоимости обслуживания

Сравнение трёх моделей с открытыми весами на основе разреженного Mixture-of-Experts — Kimi K3 от Moonshot AI, DeepSeek V4 Pro и GLM-5.2 от Zhipu AI — оценивает их возможности, условия лицензирования и стоимость обслуживания для задач программирования и работы агентов с длинным горизонтом.

media r/LocalLLaMA · 26 д назад · 1 просмотр

SAO представляет асинхронную оптимизацию с одним проходом для стабильного обучения агентного RL

В статье представлена Single-rollout Asynchronous Optimization (SAO), метод, разработанный для решения проблем стабильности и off-policy в асинхронном обучении с подкреплением для больших языковых моделей. Заменяя групповую выборку на однократную выборку, подход снижает эффекты off-policy и улучшает обобщение при выполнении долгосрочных агентных задач.

media r/LocalLLaMA · 30 д назад · 10 просмотров

Бенчмарки Databricks для кодовых агентов: pi-coding-agent дешевле, GLM 5.2 соответствует Opus

Databricks опубликовала бенчмарк кодовых агентов на своей многомиллионной кодовой базе, сообщив, что её внутренний pi-coding-agent до 2 раз дешевле Claude Code или Codex при этом демонстрируя более высокие показатели успешности. Исследование также показало, что GLM 5.2 работает на уровне с Opus 4.8 high и превосходит GPT 5.5 high и xhigh.