Исследователи представляют CodeMidas, агентный конвейер, который создает среды обучения с подкреплением из реализованной функциональности в репозиториях открытого исходного кода, используя исходный код в качестве единственного входа. Метод распределяет агентные вычислительные ресурсы для исследования функциональности, создания тестов, основанных на исполнении, и валидации задач через повторяющиеся проходы, что приводит к формированию набора данных из 5 545 обучающих задач по 23 языкам программирования. Обучение MiMo-V2.5 на этих задачах с использованием GRPO улучшает показатели на пяти разнообразных бенчмарках, включая DeepSWE (+11,7%), ProgramBench (+17%) и Terminal-Bench v2.1 (+8,5%). Анализ траекторий показывает, что агент, обученный методом RL, демонстрирует лучшее поведение, такое как более активное исследование кодовой базы и более разнообразная самопроверка. Эти результаты устанавливают исходный код в качестве масштабируемой основы для создания сред RL, улучшающих работу агентов программирования при решении различных задач в области программного обеспечения.
CodeMidas масштабирует агентные среды обучения с подкреплением для программирования на основе исходного кода
После-операторы не улучшают точность в малых моделях кода
Исследование по измерению показывает, что 26 семантических после-операторов не улучшают точность на выделенных данных по сравнению с Best-of-N в замороженных малых моделях кода. Хотя два оператора — восстановление слоя выражений и адаптивный консенсус на раннем останове — обеспечивают преимущества в эффективности вычислений или восстановлении программы, ни один из них не превосходит BoN по точности. Результаты подчеркивают системные ограничения в обнаружении и покрытии ошибок, что указывает на необходимость улучшения инструментов для обнаружения ошибок и их покрытия до того, как будет рассматриваться пост-операционное рассуждение.
Предварительная версия Atria Dawn: базовая агентная языковая модель для научных исследований
Предварительная версия Atria Dawn представляет собой базовую агентную языковую модель, предназначенную для научных исследований и инженерных рабочих процессов, обученную с помощью конвейера проверяемого опыта, который связывает опосредованные инструментами взаимодействия с исполняемыми средами. По 16 бенчмаркам, охватывающим реальные исследования, инженерию и цифровую работу, модель конкурентоспособна с передовыми агентами и достигает наивысшего зафиксированного результата в пяти из них.
Модели NVIDIA Nemotron-3 достигли золотого медали и лучших человеческих результатов на IOI 2026
Исследователи разработали конвейер постобучения для больших языковых моделей, позволяющий им показывать результаты уровня золотой медали в соревновательном программировании. Комбинируя контролируемое тонкое обучение (SFT), обучение с подкреплением и новую стратегию, основанную на обратной связи, называемую GenCorrect, система превзошла лучших человеческих участников на наборе задач IOI 2026.
Модели NVIDIA Nemotron-3 демонстрируют золотой уровень в олимпиадах по программированию IOI
NVIDIA разработала конвейеры постобучения для своих языковых моделей Nemotron-3-Nano-CC и Nemotron-3-Ultra-CC, чтобы достичь выдающихся результатов в соревновательном программировании. Объединив масштабный отбор задач, синтетические цепочки рассуждений, контролируемое тонкое настраивание и обучение с подкреплением, команда создала специализированные системы, способные к высокоуровневым алгоритмическим рассуждениям.
Модели Nemotron-3 от NVIDIA достигают золотого уровня в олимпиадах по программированию IOI
NVIDIA разработала конвейер постобучения для своих языковых моделей Nemotron-3, позволяющий им демонстрировать результаты уровня золотой медали на Международной олимпиаде по информатике (IOI). Подход сочетает масштабный отбор задач, синтетические цепочки рассуждений, контролируемое дообучение и обучение с подкреплением.