Источник · arXiv cs.LG
arxiv arXiv cs.LG · 20 д назад · 69 просмотров

Модели NVIDIA Nemotron-3 достигли золотого медали и лучших человеческих результатов на IOI 2026

Исследователи разработали конвейер постобучения для больших языковых моделей, позволяющий им показывать результаты уровня золотой медали в соревновательном программировании. Комбинируя контролируемое тонкое обучение (SFT), обучение с подкреплением и новую стратегию, основанную на обратной связи, называемую GenCorrect, система превзошла лучших человеческих участников на наборе задач IOI 2026.

arxiv arXiv cs.LG · 4 ч назад · 11 просмотров

AIDE^2 обеспечивает рекурсивное самосовершенствование агентов ИИ для научных исследований

Исследователи представляют AIDE^2 — систему, реализующую цикл рекурсивного самосовершенствования для передового агента ИИ, занимающегося научными исследованиями, путём оптимизации его собственного кода. Система предлагает изменения во внутренней логике, оценивает изменённые версии на задачах ИИ-исследований и разработок (R&D) и сохраняет только те обновления, которые показывают наилучшие результаты на скрытых оценках.

arxiv arXiv cs.LG · 5 ч назад · 9 просмотров

CliffCompaction снижает затраты на долгосрочных задачах программирования для агентов до 50%, сохраняя производительность

Исследователи представляют CliffCompaction, метод автокомпактизации, разработанный для агентов, обрабатывающих миллионы токенов, который сокращает затраты до 50% в условиях ограниченного контекста. Метод сохраняет или улучшает производительность на Terminal-Bench и достигает лучших результатов на KernelBench за счёт сохранения точности информации при усечении, а не перефразировании.

arxiv arXiv cs.LG · 1 д назад HealthBench · 50.1% · 10 просмотров

Fathom-Vaidya улучшает медицинское рассуждение с помощью наград по рубрикам

Авторы представляют Fathom-Vaidya, модель с 30B параметров, которая использует синтетические данные и подкрепляющее обучение на основе рубрик для улучшения диагностического и клинического рассуждения в здравоохранении. Процесс обучения сначала применяет RL, управляемый правилами, к вопросам из MedBullets для диагностики, а затем использует 5.3k синтетических многошаговых сценариев с многомерными рубриками для интерактивных клинических задач.

arxiv arXiv cs.LG · 7 д назад · 20 просмотров

OpenAI выпустила Open-1B с полностью проверяемым процессом обучения

OpenAI выпустила Open-1B, языковую модель, обученную в условиях, при которых каждая операция во время обучения может быть независимо воспроизведена на разнородном стандартном оборудовании с битовой точностью. Этот подход решает проблемы воспроизводимости, присущие моделям с открытым исходным кодом, путем установления строгого порядка для источников недетерминизма, таких как редукция GPU-ядер и порядок формирования пакетов данных.

arxiv arXiv cs.LG · 8 д назад Codeforces (Elo) · 98.2% · 25 просмотров

Stellar Colosseum: многоагентная платформа для долгосрочных исследований в математике и теории вычислительных систем

Авторы представляют Stellar Colosseum, модель-агностическую платформу, предназначенную для распределения вывода при проведении долгосрочных исследований в области математики и теоретической информатики. Система исследует альтернативные стратегии до начала построения доказательства, использует вентиль готовности для определения момента, когда маршрут достаточно зрел для декомпозиции, и представляет план доказательства как взаимосвязанные подзадачи на уровне разделов.

arxiv arXiv cs.LG · 12 д назад · 29 просмотров

Vidu S2 представляет модели интерактивных аватаров и редактирования в реальном времени

Vidu S2 включает Vidu S2-Avatar, модель интерактивного цифрового персонажа в реальном времени, и Vidu S2-Editing, модель видеоредактирования в реальном времени. Система также исследует возможность генерации пространственного видео в реальном времени для обоих компонентов.

arxiv arXiv cs.LG · 14 д назад · 24 просмотра

TontaubeV1 обеспечивает потоковую генерацию речи из текста с ограниченным контекстом

Исследователи представляют модель синтеза речи из текста TontaubeV1, которая сохраняет естественную просодию и позволяет выполнять потоковый вывод на одном потребительском GPU. Система использует иерархическое представление DualCodec с частотой 12.5 Гц для разделения семантических потоков от акустических уточнений, что обеспечивает генерацию с низкой задержкой.

arxiv arXiv cs.LG · 16 д назад · 30 просмотров

Метод спекулятивной неопределённости снижает ошибки агентов программной инженерии с помощью гейтирования черновик-моделью

Авторы представляют Speculative Uncertainty (SU), технику, которая восстанавливает сигнал предсказательного сбоя для black-box LLM-агентов путём анализа только их выходных токенов, без необходимости доступа к логитам, весам или активациям. Инвертируя спекулятивное декодирование, небольшая открытая черновик-модель оценивает траекторию агента за один прямой проход для извлечения фазово-осознанных признаков и калибровки их по проверяемой цели.

arxiv arXiv cs.LG · 19 д назад · 42 просмотра

FlashAttention-4 представляет Direct-P для аппаратно-ориентированного вывода и обучения в формате FP4

FlashAttention-4 решает проблемы производительности тензорных ядер 4-битной плавающей точки (FP4) архитектуры Blackwell, внедряя новые пути для некаузального вывода и каузального обучения. Метод, названный Direct-P, напрямую отображает оценки в вероятности FP4, чтобы обойти накладные расходы на преобразование softmax, которые обычно доминируют при уменьшении размеров матричных произведений.

arxiv arXiv cs.LG · 21 д назад SWE-bench Verified · 16.6% · 36 просмотров

CANOPY позволяет Qwen3-14B занять первое место в AppWorld с помощью RL только по результату

В статье представлен CANOPY (Coverage-ANchored On-PolicY RL) — протокол, решающий проблему недостатка сигналов и смещения политики в долгосрочном обучении с подкреплением для небольших открытых моделей. За счёт масштабирования исследования в рамках одной задачи и удержания обновлений, привязанных к KL-дивергенции, метод позволяет агентам эффективно учиться исключительно на основе проверки завершения задачи.

arxiv arXiv cs.LG · 29 д назад · 32 просмотра

Apodex 1.1 масштабирует агентный интеллект через масштабирование среды и координации

Apodex 1.1 вводит «рабочую способность» для обеспечения устойчивого, проверяемого прогресса в достижении реальных целей посредством двух дополнительных измерений: масштабирования среды и масштабирования агентной координации.