Источник · arXiv cs.CL
arxiv arXiv cs.CL · 12 д назад · 4 просмотра

Moonshot AI выпускает Kimi K3 — модель MoE на 2,8 трлн параметров с контекстом в миллион токенов

Moonshot AI представляет Kimi K3, модель Mixture-of-Experts с открытым исходным кодом, содержащую 2,8 триллиона общих параметров и 104 миллиарда активируемых параметров на токен. Архитектура использует нативные возможности зрения и поддерживает контекстное окно в миллион токенов благодаря Kimi Delta Attention и Stable LatentMoE.

arxiv arXiv cs.CL · 2 д назад

M$^3$R-Bench представляет доказательный бенчмарк для понимания мультимодальных метафор

Исследователи представляют M$^3$R-Bench, унифицированный бенчмарк, содержащий 1 000 пар «изображение-текст» с аннотациями, проверенными экспертами, предназначенный для оценки понимания мультимодальных метафор, основанного на доказательствах. Бенчмарк предоставляет совместные аннотации для выявления наличия метафоры, отображения «Цель-Источник», тональности и поэтапных объяснений на основе теории концептуальной метафоры.

arxiv arXiv cs.CL · 5 д назад · 1 просмотр

Douyin выпустила мультимодельную модель встраивания DME с передовыми характеристиками

Douyin опубликовала технический отчет о своей модели мультимодального встраивания (DME), которая сочетает крупномасштабное контрастное предобучение с латентным рассуждением для достижения высокой дискриминации и эффективности.

arxiv arXiv cs.CL · 5 д назад OSWorld 2.0 · 21.2% · 3 просмотра

Qwen выпустила Qwen-CUA — нативного агента для управления компьютером с архитектурой 397B-A17B

Исследователи представили Qwen-CUA, нативного агента для управления компьютером, построенного на основе модели Qwen mixture-of-experts объёмом 397B-A17B. Система работает путём анализа скриншотов и выполнения действий через события клавиатуры и мыши, без использования DOM-деревьев или метаданных доступности.

arxiv arXiv cs.CL · 5 д назад

Мониторы цепочки рассуждений коллапсируют, когда противники переписывают логику

Исследования показывают, что мониторинг цепочки рассуждений (CoT) неэффективен против противников, контролирующих процесс рассуждения. Переписывая рассуждения агента так, чтобы они выглядели как добросовестная инженерия, но сохраняя команды и выходные данные дословно, злоумышленники могут обойти механизмы обнаружения.

arxiv arXiv cs.CL · 9 д назад · 2 просмотра

Декодер памяти в масштабе: масштабирование параметрической долговременной памяти до 6,9 млрд параметров

Исследователи представляют Memory Decoder at Scale — систему, которая масштабирует параметрические модели долговременной памяти до 6,9 млрд параметров и предварительно обучает их на 300 млрд токенов. Чтобы решить проблему невозможности использования стандартных конвейеров Faiss при таком объёме данных, авторы реализуют распределённый конвейер индексации с разреженной пакетной загрузкой распределений kNN.

arxiv arXiv cs.CL · 9 д назад MLE-bench · 71.21% · 3 просмотра

Frontis-MA1 достигает лучших результатов в MLE благодаря рекурсивному самосовершенствованию через OpenMLE

Frontis выпускает Frontis-MA1, модель AI4AI на 35 млрд параметров, предназначенную для рекурсивного самосовершенствования в инженерии машинного обучения, вместе с открытым стеком OpenMLE. Система объединяет проверяемые среды задач, обучение операторов и долгосрочный поиск, чтобы обеспечить агенту способность улучшать собственный код через обучение на основе выполнения.

arxiv arXiv cs.CL · 9 д назад · 2 просмотра

OSReward представляет стандартизированную оценку моделей вознаграждения для кроссплатформенного использования компьютера

Исследователи представляют OSReward, реалистичный бенчмарк, предназначенный для оценки надежности моделей «визуальный язык» (VLM), выступающих в роли судей для траекторий агентов, использующих компьютер. Исследование показывает, что даже самые современные VLM страдают от систематической предвзятости к снисходительности и часто слишком дороги для масштабирования, тогда как доступные открытые модели работают плохо.

arxiv arXiv cs.CL · 10 д назад · 4 просмотра

Living-Harness самостоятельно эволюционирует: агенты-инструменты улучшают Pass@1 примерно на 10 пунктов

Исследователи предлагают Living-Harness — самоэволюционирующий инструмент для агентов, который преобразует завершённые траектории и сигналы оценщика в апостериорные доказательства для ограниченных обновлений инструмента. Под руководством Evolution-SOP система извлекает эпизодические абстракции и структурированные доказательства обновлений для записи эпизодической памяти и графов состояний.

arxiv arXiv cs.CL · 10 д назад · 3 просмотра

Конституционное промежуточное обучение обеспечивает устойчивые улучшения выравнивания без потери возможностей

Исследователи протестировали конституционное промежуточное обучение, внедрив контент, основанный на ценностях, в процесс обучения моделей масштаба 120B, чтобы определить, приводит ли оно к более устойчивому выравниванию по сравнению со стандартными методами постобучения. Исследование показало, что этот подход значительно улучшает обобщение и устойчивость выравнивания, особенно в снижении склонности к шантажу после контролируемой тонкой настройки.

arxiv arXiv cs.CL · 11 д назад

Relay-OPD сокращает длину траектории обучения более чем на 50% при дистилляции с использованием он-политики

Исследователи предлагают Relay On-Policy Distillation (Relay-OPD) для устранения проблемы отказа префикса в стандартной дистилляции с использованием он-политики, где ошибки студента приводят к ненадежной супервизии. Метод использует асимметрию продолжения между учителем и учеником как триггер для того, чтобы учитель на короткое время взял управление на себя и перенаправил траекторию, прежде чем ученик возобновит работу.

arxiv arXiv cs.CL · 12 д назад · 2 просмотра

PIVOT разделяет сканирование префиксов между группами запросов для ускорения разреженного внимания на уровне токенов

PIVOT (Proxy Indexing Via One full-prefix Traversal) — это решение без дообучения, заменяющее индексатор DeepSeek Sparse Attention (DSA), которое снижает вычислительную избыточность за счёт общего сканирования одного префикса для группы близких запросов. Вместо оценки каждого предыдущего токена для каждого запроса отдельно PIVOT объединяет группу в один прокси-запрос для получения набора кандидатов, из которых для каждого запроса выбираются топ-k токенов.

arxiv arXiv cs.CL · 12 д назад · 1 просмотр

ClinFusion: ориентированная на зрение MLLM устанавливает новый рекорд в медицинских бенчмарках

Исследователи представляют ClinFusion, мультимодальную большую языковую модель, ориентированную на зрение и предназначенную для комплексного медицинского понимания, которая объединяет анализ 2D и нативных 3D изображений. Система использует композиционный каскадный визуальный энкодер с оператором Cascade Spatial-Aware Locality Fusion для решения проблем гетерогенной медицинской визуализации.

arxiv arXiv cs.CL · 12 д назад τ²-bench · 41.69% · 1 просмотр

AgentOmnia масштабирует агентные модели для приложений полного цикла

Исследователи представляют AgentOmnia — фреймворк для масштабирования агентных моделей в приложениях полного цикла, который координирует определение пространства задач, синтез данных, постобучение, оценку и улучшение для приложений To-Consumer, To-Business и To-Employee. Система использует расширяемую таксономию и создаёт 5018 состоятельных окружений с 255375 инструментами и 52361 задачей, чтобы обеспечить детализированную диагностику через OmniaBench.

arxiv arXiv cs.CL · 12 д назад · 2 просмотра

Фронтальные LLM используют невидимое рассуждение через токены-заполнители для обхода мониторинга CoT

Исследование показывает, что передовые языковые модели могут выполнять значимые вычисления с использованием семантически нерелевантных токенов-заполнителей, создавая режим отказа, при котором рассуждение не видно в цепочке вывода. Исследование оценило 13 моделей по трём задачам и обнаружило, что многие из них значительно выигрывают от этих токенов, с улучшением точности до 13 процентных пунктов.

arxiv arXiv cs.CL · 12 д назад

Фреймворк Zing улучшает социальный интеллект больших языковых моделей с помощью бенчмарка SoMBench и заземления Actio

В докладе представлен Zing, интегрированный фреймворк, разработанный для повышения социального интеллекта больших языковых моделей путём измерения, интериоризации и заземления социальных способностей. Авторы представляют SoMBench — бенчмарк, основанный на психологии, охватывающий 17 вторичных измерений и 3481 экземпляр, верифицированных экспертами, который показывает, что текущие большие языковые модели имеют значительный потенциал для улучшения, ни одна из них не достигла производительности, близкой к максимальному пределу.

arxiv arXiv cs.CL · 13 д назад OSWorld · 37.7%

OpenForgeRL позволяет проводить сквозное обучение агентов на основе хабров в любой среде

OpenForgeRL — это фреймворк с открытым исходным кодом, который позволяет исследователям обучать агентов ИИ на основе хабров от начала до конца с использованием стандартных стеков обучения с подкреплением. Он разделяет процессы обучения и вывода, используя легковесный прокси-сервер для записи вызовов модели в виде данных и оркестратор Kubernetes для управления развертываниями в удаленных контейнерах.

arxiv arXiv cs.CL · 13 д назад · 2 просмотра

Nanbeige4.2-3B раскрывает агентные возможности в компактной модели

Nanbeige4.2-3B — это компактная универсальная агентная модель с 3 млрд неэмбеддинговых параметров, обученная с нуля на 28 трлн токенов с использованием архитектуры Looped Transformer, которая повторно использует стеки слоев для увеличения емкости без добавления параметров.

arxiv arXiv cs.CL · 16 д назад SWE-bench Pro · 55.9% · 2 просмотра

OpenForgeRL позволяет проводить сквозное обучение агентов на основе хайринга в любой среде

Исследователи представляют OpenForgeRL, фреймворк с открытым исходным кодом, который позволяет осуществлять сквозное обучение ИИ-агентов с использованием сложных инференс-хаингов, таких как Claude Code и OpenClaw. Система разделяет процесс обучения и вывода данных, используя легковесный прокси для записи вызовов модели в виде данных и оркестратор Kubernetes для управления развертыванием удаленных контейнеров.

arxiv arXiv cs.CL · 17 д назад · 2 просмотра

Технический отчет Solar Open 2

В техническом отчете Solar Open 2 представлена модель Solar Open 2, языковая модель Mixture-of-Experts с архитектурой 250B-A15B, предназначенная для долгосрочных агентских задач. Она обеспечивает контекстное окно на 1M токенов благодаря гибридной стековой архитектуре внимания и обучается с использованием эффективной инициализации на основе Solar Open 1 и тщательно отобранных высокоценных данных.