Источник · arXiv cs.CL
arxiv arXiv cs.CL · 20 д назад · 31 просмотр

Модели NVIDIA Nemotron-3 демонстрируют золотой уровень в олимпиадах по программированию IOI

NVIDIA разработала конвейеры постобучения для своих языковых моделей Nemotron-3-Nano-CC и Nemotron-3-Ultra-CC, чтобы достичь выдающихся результатов в соревновательном программировании. Объединив масштабный отбор задач, синтетические цепочки рассуждений, контролируемое тонкое настраивание и обучение с подкреплением, команда создала специализированные системы, способные к высокоуровневым алгоритмическим рассуждениям.

arxiv arXiv cs.CL · 7 ч назад · 12 просмотров

Agensh масштабирует организационный интеллект до 1024 агентов

Исследователи представляют Agensh, масштабируемую самоорганизующуюся многоагентную среду, которая устраняет узкое место центрального оркестратора, позволяя параллельным рабочим асинхронно брать подзадачи и объединять прогресс.

arxiv arXiv cs.CL · 7 ч назад · 11 просмотров

TelecomGPT-R1: Единое постобучение для рассуждений в гетерогенных телекоммуникационных задачах

Исследователи представляют TelecomGPT-R1, семейство открытых унифицированных моделей рассуждений для телекоммуникаций, предназначенных для автоматизации инженерных задач путем анализа стандартов, конфигураций и журналов. Модель решает ограничения существующих универсальных и специализированных LLM посредством структурированного подхода, охватывающего протоколы, знания, моделирование и устранение неисправностей.

arxiv arXiv cs.CL · 7 ч назад · 11 просмотров

Qwen выпустила Qwen3.8-Omni-Flash, нативную мультимодальную агентную модель с контекстом в 1 млн токенов

Alibaba Cloud представила Qwen3.8-Omni-Flash, нативную мультимодальную агентную модель, предназначенную для решения практических задач продуктивности, которая существенно улучшает мультимодальное понимание и рассуждение по сравнению с предыдущими омни-моделями.

arxiv arXiv cs.CL · 1 д назад HealthBench · 50.1% · 12 просмотров

Fathom-Vaidya улучшает медицинское рассуждение с помощью наград по рубрикам

Авторы представляют Fathom-Vaidya, модель с 30B параметров, которая использует синтетические данные и подкрепляющее обучение, основанное на рубриках, для улучшения как диагностического, так и клинического рассуждения в здравоохранении.

arxiv arXiv cs.CL · 1 д назад · 11 просмотров

AgentRouter снижает стоимость агентных рабочих процессов на 72 % за счёт маршрутизации моделей на уровне шагов

Исследователи предлагают AgentRouter — лёгкий классификатор, оптимизирующий многошаговые агентные рабочие процессы путём маршрутизации отдельных шагов траектории к соответствующим уровням моделей вместо использования одной передовой модели для всех задач. Система устраняет неэффективность корпоративных систем, которые тратят 60–80 % своего бюджета на вывод на подзадачи, с которыми меньшие модели справляются столь же хорошо.

arxiv arXiv cs.CL · 2 д назад · 13 просмотров

NemotronLabs выпускает VoiceChat — открытую полнодуплексную модель преобразования речи в речь с вызовом инструментов

NemotronLabs представила VoiceChat, открытую полнодуплексную модель преобразования речи в речь с открытыми весами, предназначенную для интеграции прослушивания, транскрипции, рассуждений и генерации речи в рамках единой потоковой архитектуры. Система объединяет потоковый речевой энкодер и декодирующую языковую модель с параллельными специализированными выходными потоками для текста агента и структурированных вызовов функций, а также вспомогательным ветвлением RNN-T для инкрементальной транскрипции пользователя.

arxiv arXiv cs.CL · 2 д назад · 10 просмотров

TrialAtlas: многоагентная система улучшает оценку рисков при проектировании клинических испытаний

Исследователи представили TrialAtlas, организацию для исследований с расширенной памятью на основе нескольких агентов, предназначенную для помощи в планировании клинической разработки (CDP). Система координирует специализированные агенты для синтеза литературы, конкурентной разведки и регуляторного анализа, чтобы прогнозировать риски разработки.

arxiv arXiv cs.CL · 6 д назад · 22 просмотра

Модели уровня Frontier оцениваются в игре log(N)-вопросов по Википедии

Исследование оценивает шесть языковых моделей уровня Frontier в задаче коммуникации двух агентов, где отвечающий на вопросы определяет цель из N абзацев Википедии, используя ровно log2(N) вопросов с ответами «да»/«нет». Эксперимент провёл 408 игр на наборах документов от 4 до 1024 абзацев, выявив значительные различия в производительности среди протестированных моделей.

arxiv arXiv cs.CL · 8 д назад Codeforces (Elo) · 98.2% · 27 просмотров

Stellar Colosseum использует многоагентный вывод для долгосрочных математических исследований

Stellar Colosseum — это модель-агностический фреймворк, предназначенный для распределения вывода при проведении долгосрочных исследований в области математики и теоретической информатики, что позволяет решить проблему ненадежности языковых моделей при работе со сложными задачами. Система исследует альтернативные стратегии до начала построения доказательства, использует вентиль готовности для определения момента, когда маршрут достаточно зрел для декомпозиции, и представляет план доказательства как набор взаимосвязанных подзадач на уровне разделов.

arxiv arXiv cs.CL · 13 д назад · 28 просмотров

Односторонняя атака на GLM-5.3-Flash выявляет хрупкость безопасности в моделях MoE

Исследователи демонстрируют, что направленная абляция — атака с открытым исходным кодом, устраняющая отказ путем проецирования одного направления из весов, остается эффективной для передовых моделей смешанных экспертов (MoE), таких как GLM-5.3-Flash. Исследование показывает, что хотя атака выживает в архитектуре, ее эффекты распределяются по вниманию, плотным и маршрутизируемым экспертам, а не сосредоточены в одном месте.

arxiv arXiv cs.CL · 14 д назад SWE-bench Verified · 72.6% · 25 просмотров

ExecCritic использует ролевое RL для улучшения кодогенерирующих агентов через тест-ориентированное исправление

Исследователи представляют ExecCritic — фреймворк, сочетающий структуру test-verify-revise с ролевым обучением с подкреплением для повышения эффективности кодогенерирующих агентов. Система разделяет создание тестов и исправление исходного кода: Test-агент генерирует тесты, специфичные для репозитория, а Repair-агент корректирует код на основе обратной связи от выполнения.

arxiv arXiv cs.CL · 14 д назад · 25 просмотров

TontaubeV1 обеспечивает потоковую генерацию речи из текста с ограниченным контекстом

Исследователи представляют TontaubeV1 — модель преобразования текста в речь, которая сохраняет естественную просодию и позволяет выполнять потоковый вывод на одной потребительской GPU. Система использует иерархическое представление DualCodec с частотой 12.5 Гц для разделения семантических потоков от акустических уточнений, что позволяет осуществлять каузальное декодирование, несмотря на некаузальный характер базового кодека.

arxiv arXiv cs.CL · 14 д назад · 18 просмотров

Технический отчет AuK: открытая базовая модель для генерации и редактирования речи

В техническом отчете AuK представлена открытая базовая модель, объединяющая генерацию и редактирование речи с помощью инструкций на естественном языке и аудио-контекста.

arxiv arXiv cs.CL · 19 д назад · 36 просмотров

VisCAD выпускает набор фундаментальных моделей с мультимодальным интеллектом для промышленного САПР

Исследователи представляют VisCAD, набор фундаментальных моделей, предназначенный для обеспечения широкой обобщающей способности и сильных возможностей в области реалистичного проектирования промышленных изделий. Набор решает задачи генерации на уровне деталей из разнообразных входных данных, таких как рендеры и текст, а также генерации на уровне сборки с участием взаимодействующих деталей.

arxiv arXiv cs.CL · 20 д назад · 40 просмотров

DisCo превращает репозитории GitHub в навыки для AI4AI, повышая эффективность исследовательских агентов

Авторы представляют DisCo — исследовательского агента с навыками, предназначенного для устранения пробелов в операционных знаниях путём извлечения специфических для области знаний из внешних источников. Система преобразует широко используемые репозитории машинного обучения в переиспользуемые, проверенные навыки посредством двух взаимодополняющих форм: обобщённого дистиллирования для широкого применения и ориентированного на задачу дистиллирования для конкретных нужд.

arxiv arXiv cs.CL · 20 д назад · 28 просмотров

APEx дистиллирует процедурный опыт агента для адаптивного глубокого исследования

Исследователи предлагают APEx, иерархическую систему использования опыта, предназначенную для улучшения агентов глубокого исследования, отвечающих на сложные вопросы с использованием внешних инструментов. Система организует историю взаимодействий в траекторные воспоминания уровня экземпляра и процедурные навыки уровня категории, связывая их через архитектуру Executor, Distiller и Planner.

arxiv arXiv cs.CL · 21 д назад · 17 просмотров

TrialGPT 2.0 повышает эффективность и доступность подбора клинических испытаний в многоцентровой оценке

Авторы представляют TrialGPT 2.0, систему рекомендаций по клиническим испытаниям с поддержкой ИИ, предназначенную для развертывания в реальных условиях, которая оценивает, какие испытания заслуживают рассмотрения на основе потребностей пациентов и приоритетов рабочего процесса.

arxiv arXiv cs.CL · 21 д назад · 23 просмотра

Консолидация более 200 приложений на одном самохостинговом LLM с помощью многоосевого GRPO и SLERP

В статье описывается метод консолидации трафика от более чем 200 внутренних приложений на одном самохостинговом большой языковой модели для решения проблем соответствия требованиям резидентности данных и фрагментации GPU. Подход устраняет разрывы в качестве выполнения инструкций, вызова функций и распределения внутренних задач путем обучения отдельных экспертов GRPO по каждой оси и их объединения с помощью двухэтапного SLERP.