Источник · arXiv cs.AI
arxiv arXiv cs.AI · 20 д назад · 36 просмотров

Модели Nemotron-3 от NVIDIA достигают золотого уровня в олимпиадах по программированию IOI

NVIDIA разработала конвейер постобучения для своих языковых моделей Nemotron-3, позволяющий им демонстрировать результаты уровня золотой медали на Международной олимпиаде по информатике (IOI). Подход сочетает масштабный отбор задач, синтетические цепочки рассуждений, контролируемое дообучение и обучение с подкреплением.

arxiv arXiv cs.AI · 2 ч назад · 9 просмотров

AIDE^2 обеспечивает рекурсивное самосовершенствование агентов ИИ для научных исследований

Исследователи представляют AIDE^2 — систему, реализующую цикл рекурсивного самосовершенствования для агента ИИ в области научных исследований за счёт оптимизации его собственного кода. Система предлагает изменения во внутренней логике, оценивает изменённые версии на задачах научно-исследовательской деятельности в сфере ИИ и сохраняет только те улучшения, которые показывают наилучшие результаты на скрытых оценках.

arxiv arXiv cs.AI · 3 ч назад WebArena · 45.3% · 13 просмотров

Growing Harness превращает повторяющееся управление агентами в переиспользуемый код с помощью обучения, направляемого ошибками

Авторы представляют Growing Harness — парадигму обучения, которая изучает структуру управления агентом на основе обратной связи от задач, а не полагается на стандартные тяжеловесные контекстные обвязки. Преобразуя повторяющиеся решения по управлению в исполняемый код и оставляя вызовы LLM для семантического рассуждения, метод стремится создавать переиспользуемых специализированных агентов.

arxiv arXiv cs.AI · 4 ч назад · 9 просмотров

CliffCompaction снижает затраты на кодирование агентов на 50% при сохранении производительности

Исследователи представляют CliffCompaction, технику автокомпактизации, предназначенную для снижения затрат на долгосрочных кодовых агентах до 50% в рамках ограниченного контекста. Метод сохраняет или улучшает производительность на Terminal-Bench и достигает лучших результатов на KernelBench за счёт сохранения точности сжатой информации через усечение, а не перефразирование.

arxiv arXiv cs.AI · 5 ч назад · 10 просмотров

VideoX-Qwen представляет центрированную на данных структуру для редактирования видео по инструкциям

Исследователи представляют VideoX-Qwen, интегрированную структуру, сочетающую масштабируемое конструирование данных с обучением модели для продвижения общего назначения, управляемого инструкциями, редактирования видео. Система использует производственный конвейер, который организует специализированные модели для генерации записей направленного редактирования, что приводит к более чем 1,2 миллиона высококачественных образцов по задачам добавления, удаления, замены и атрибутов.

arxiv arXiv cs.AI · 22 ч назад · 11 просмотров

Генератор состояния мира согласует планы с синтетическими мирами для повышения успеха агентов

Генератор состояния мира (WSG) — это модель, которая удерживает планы языковых агентов в соответствии с правилами их среды выполнения, переписывая состояния после неудач. Она обучена на 226K траекториях, извлечённых из семи синтетических доменов, где программа обеспечивает соблюдение правил и проверяет достижимость цели.

arxiv arXiv cs.AI · 1 д назад HealthBench · 50.1% · 12 просмотров

Fathom-Vaidya улучшает медицинское рассуждение с помощью наград по рубрикам

Авторы представляют Fathom-Vaidya, модель с 30B параметров, которая использует синтетические данные и подкрепляющее обучение на основе рубрик для улучшения как диагностического, так и клинического медицинского рассуждения. Процесс обучения сначала направлен на повышение точности диагностики с использованием вопросов, полученных из MedBullets, а затем решает задачи многооборотного клинического взаимодействия через 5.3k сгенерированных сценариев с многомерными рубриками.

arxiv arXiv cs.AI · 1 д назад · 9 просмотров

AgentRouter снижает стоимость агентных рабочих процессов на 72% за счёт маршрутизации моделей на уровне шагов

Исследователи предлагают AgentRouter, лёгкий классификатор, который оптимизирует многошаговые агентные рабочие процессы, направляя отдельные шаги траектории в соответствующие уровни моделей вместо использования передовых моделей для каждой задачи. Система решает проблему неэффективности существующих решений, которые игнорируют различную сложность подзадач внутри одной сессии агента.

arxiv arXiv cs.AI · 2 д назад · 13 просмотров

NemotronLabs выпускает VoiceChat: открытую полнодуплексную модель преобразования речи в речь с вызовом инструментов

NemotronLabs представила NemotronLabs VoiceChat, открытую полнодуплексную модель преобразования речи в речь с весами, которая интегрирует нативные возможности вызова инструментов в единую потоковую архитектуру. Система объединяет потоковый речевой энкодер и языковую модель только для декодирования с параллельными выходными потоками для текста агента и структурированных вызовов функций, а также вспомогательный ветвь RNN-T для инкрементальной транскрипции и потоковый декодер TTS.

arxiv arXiv cs.AI · 2 д назад · 18 просмотров

CodeMidas масштабирует агентные среды обучения с подкреплением для программирования на основе исходного кода

Исследователи представляют CodeMidas, агентный конвейер, который создает среды обучения с подкреплением из реализованной функциональности в репозиториях открытого исходного кода, используя исходный код в качестве единственного входа. Метод распределяет агентные вычислительные ресурсы для исследования функциональности, создания тестов, основанных на исполнении, и валидации задач через повторяющиеся проходы, что приводит к формированию набора данных из 5 545 обучающих задач по 23 языкам программирования. Обучение MiMo-V2.5 на этих задачах с использованием GRPO улучшает показатели на пяти разнообразных бенчмарках, включая DeepSWE (+11,7%), ProgramBench (+17%) и Terminal-Bench v2.1 (+8,5%). Анализ траекторий показывает, что агент, обученный методом RL, демонстрирует лучшее поведение, такое как более активное исследование кодовой базы и более разнообразная самопроверка. Эти результаты устанавливают исходный код в качестве масштабируемой основы для создания сред RL, улучшающих работу агентов программирования при решении различных задач в области программного обеспечения.

arxiv arXiv cs.AI · 8 д назад · 24 просмотра

Предварительная версия Atria Dawn: базовая агентная языковая модель для научных исследований

Предварительная версия Atria Dawn представляет собой базовую агентную языковую модель, предназначенную для научных исследований и инженерных рабочих процессов, обученную с помощью конвейера проверяемого опыта, который связывает опосредованные инструментами взаимодействия с исполняемыми средами. По 16 бенчмаркам, охватывающим реальные исследования, инженерию и цифровую работу, модель конкурентоспособна с передовыми агентами и достигает наивысшего зафиксированного результата в пяти из них.

arxiv arXiv cs.AI · 8 д назад Codeforces (Elo) · 98.2% · 13 просмотров

Stellar Colosseum использует многоагентный вывод для долгосрочных математических исследований и TCS

Авторы представляют Stellar Colosseum, модель-независимый фреймворк, предназначенный для распределения вывода на долгосрочные исследовательские задачи в области математики и теоретической информатики. Система исследует альтернативные стратегии до построения доказательства, использует вентиль готовности для определения момента декомпозиции маршрутов и представляет планы доказательств как взаимосвязанные подзадачи.

arxiv arXiv cs.AI · 9 д назад · 25 просмотров

Экспертная повторная оценка показывает, что передовые модели достигли почти насыщения на физических бенчмарках

Исследование, проверяющее шесть широко используемых физических бенчмарков, выявило, что низкие результаты, сообщаемые для передовых языковых моделей, в значительной степени обусловлены ошибками бенчмаркинга, а не недостатками самих моделей. Эксперты проанализировали формулировки задач, эталонные решения и ответы моделей, отделив реальные ошибки от ошибок оценщиков, неверных ссылок и неоднозначных вопросов.

arxiv arXiv cs.AI · 12 д назад · 17 просмотров

AgentZip снижает потребление памяти в песочнице AI-агентов до 8,7 раз

Исследователи представляют AgentZip, систему сжатия памяти, специально разработанную для высоконагруженных песочниц AI-агентов для устранения узких мест памяти, вызванных одновременными сессиями.

arxiv arXiv cs.AI · 13 д назад · 18 просмотров

Show-Harness позволяет агентам VLM управлять роботами через компактный семантический интерфейс

Авторы представляют Show-Harness, воплощённый Harness, который позволяет моделям с зрительно-языковыми возможностями (VLM) управлять роботами через компактный семантический интерфейс, связывающий намерение с действием. Эта система предоставляет дискретные семантические единицы действий для рассуждений VLM и использует интерпретаторы, специфичные для воплощения, чтобы привязать их к локальным действиям робота.

arxiv arXiv cs.AI · 14 д назад SWE-bench Verified · 72.6% · 29 просмотров

ExecCritic использует специфичное для роли обучение с подкреплением для улучшения кодогенерирующих агентов посредством ремонта, направляемого тестами

ExecCritic представляет собой фреймворк, который разделяет конструирование тестов и исправление исходного кода, чтобы предотвратить ложное доверие к кодогенерирующим агентам. Система использует Test agent и Repair agent, оба из которых поддерживаются моделью Qwen-3.5-35B-A3B и обучаются отдельно с помощью обучения с подкреплением.

arxiv arXiv cs.AI · 14 д назад · 18 просмотров

Оценки производительности API в бенчмарках завышают показатели интерфейсов чат-ботов

Аудит ChatGPT, Claude и Gemini показывает, что метрики оценки по API не переносятся надёжно на развернутые интерфейсы чат-ботов. Исследование выявляет «разрыв контекстной валидности», при котором измерения на основе API систематически отличаются от реального использования.

arxiv arXiv cs.AI · 14 д назад · 21 просмотр

Doctorina превосходит врачей в диагностике первичной медико-санитарной помощи на синтетическом польском языке

Исследование сравнило клиническую систему искусственного интеллекта Doctorina с участием восьми врачей и четырех автономных передовых языковых моделей в рамках 150 синтетических консультаций по первичной медико-санитарной помощи на польском языке.

arxiv arXiv cs.AI · 20 д назад · 34 просмотра

DisCo превращает репозитории GitHub в более чем 5000 навыков для ИИ-исследований

Исследователи представляют DisCo, автономного агента с поддержкой навыков, призванного сократить разрыв в операционных знаниях для исследований в области машинного обучения за счёт извлечения экспертизы из репозиториев кода. Система конденсирует широко используемые проекты с открытым исходным кодом в переиспользуемые, проверенные навыки посредством двух взаимодополняющих форм: обобщённой дистилляции для общих экосистем и ориентированной на задачу генерации для конкретных нужд.

arxiv arXiv cs.AI · 20 д назад · 29 просмотров

APEx дистиллирует процедурный опыт агента для адаптивного глубокого исследования

Исследователи предлагают APEx, иерархическую структуру использования опыта, которая организует историю взаимодействий в траекторные воспоминания на уровне экземпляров и процедурные навыки на уровне категорий для улучшения агентов глубокого исследования.