Research paper
arxiv arXiv cs.AI · 2 ч назад · 9 просмотров

AIDE^2 обеспечивает рекурсивное самосовершенствование агентов ИИ для научных исследований

Исследователи представляют AIDE^2 — систему, реализующую цикл рекурсивного самосовершенствования для агента ИИ в области научных исследований за счёт оптимизации его собственного кода. Система предлагает изменения во внутренней логике, оценивает изменённые версии на задачах научно-исследовательской деятельности в сфере ИИ и сохраняет только те улучшения, которые показывают наилучшие результаты на скрытых оценках.

arxiv arXiv cs.AI · 3 ч назад WebArena · 45.3% · 13 просмотров

Growing Harness превращает повторяющееся управление агентами в переиспользуемый код с помощью обучения, направляемого ошибками

Авторы представляют Growing Harness — парадигму обучения, которая изучает структуру управления агентом на основе обратной связи от задач, а не полагается на стандартные тяжеловесные контекстные обвязки. Преобразуя повторяющиеся решения по управлению в исполняемый код и оставляя вызовы LLM для семантического рассуждения, метод стремится создавать переиспользуемых специализированных агентов.

arxiv arXiv cs.LG · 4 ч назад · 11 просмотров

AIDE^2 обеспечивает рекурсивное самосовершенствование агентов ИИ для научных исследований

Исследователи представляют AIDE^2 — систему, реализующую цикл рекурсивного самосовершенствования для передового агента ИИ, занимающегося научными исследованиями, путём оптимизации его собственного кода. Система предлагает изменения во внутренней логике, оценивает изменённые версии на задачах ИИ-исследований и разработок (R&D) и сохраняет только те обновления, которые показывают наилучшие результаты на скрытых оценках.

arxiv arXiv cs.CL · 6 ч назад · 12 просмотров

Agensh масштабирует организационный интеллект до 1024 агентов

Исследователи представляют Agensh, масштабируемую самоорганизующуюся многоагентную среду, которая устраняет узкое место центрального оркестратора, позволяя параллельным рабочим асинхронно брать подзадачи и объединять прогресс.

arxiv arXiv cs.CL · 7 ч назад · 11 просмотров

TelecomGPT-R1: Единое постобучение для рассуждений в гетерогенных телекоммуникационных задачах

Исследователи представляют TelecomGPT-R1, семейство открытых унифицированных моделей рассуждений для телекоммуникаций, предназначенных для автоматизации инженерных задач путем анализа стандартов, конфигураций и журналов. Модель решает ограничения существующих универсальных и специализированных LLM посредством структурированного подхода, охватывающего протоколы, знания, моделирование и устранение неисправностей.

arxiv arXiv cs.LG · 1 д назад HealthBench · 50.1% · 9 просмотров

Fathom-Vaidya улучшает медицинское рассуждение с помощью наград по рубрикам

Авторы представляют Fathom-Vaidya, модель с 30B параметров, которая использует синтетические данные и подкрепляющее обучение на основе рубрик для улучшения диагностического и клинического рассуждения в здравоохранении. Процесс обучения сначала применяет RL, управляемый правилами, к вопросам из MedBullets для диагностики, а затем использует 5.3k синтетических многошаговых сценариев с многомерными рубриками для интерактивных клинических задач.

arxiv arXiv cs.AI · 1 д назад HealthBench · 50.1% · 12 просмотров

Fathom-Vaidya улучшает медицинское рассуждение с помощью наград по рубрикам

Авторы представляют Fathom-Vaidya, модель с 30B параметров, которая использует синтетические данные и подкрепляющее обучение на основе рубрик для улучшения как диагностического, так и клинического медицинского рассуждения. Процесс обучения сначала направлен на повышение точности диагностики с использованием вопросов, полученных из MedBullets, а затем решает задачи многооборотного клинического взаимодействия через 5.3k сгенерированных сценариев с многомерными рубриками.

arxiv arXiv cs.CL · 1 д назад HealthBench · 50.1% · 12 просмотров

Fathom-Vaidya улучшает медицинское рассуждение с помощью наград по рубрикам

Авторы представляют Fathom-Vaidya, модель с 30B параметров, которая использует синтетические данные и подкрепляющее обучение, основанное на рубриках, для улучшения как диагностического, так и клинического рассуждения в здравоохранении.

lab Microsoft Research Blog · 2 д назад · 29 просмотров

Microsoft выпустила RetroChimera для предсказания ретросинтеза

Microsoft Research опубликовала и открыла исходный код RetroChimera, новой системы для предсказания ретросинтеза, которая объединяет две взаимодополняющие модели для предложения высококачественных путей синтеза. Система интегрирует R-SMILES 2, модель на основе Transformer для de-novo генерации, с NeuralLoc, моделью на основе графовых нейронных сетей (GNN), используя обученную стратегию ансамблирования для ранжирования предсказаний.

media Hugging Face Forums · 2 д назад · 15 просмотров

Предложение по системе декомпозиции пропозиций и противоречиво-управляемого рассуждения

Автор предлагает дизайн исследования для системы рассуждения, которая обнаруживает противоречия между двумя пропозициями путем их декомпозиции на более мелкие компоненты и поиска логических коллизий, вместо того чтобы полагаться на прямое суждение LLM.

arxiv arXiv cs.AI · 2 д назад · 18 просмотров

CodeMidas масштабирует агентные среды обучения с подкреплением для программирования на основе исходного кода

Исследователи представляют CodeMidas, агентный конвейер, который создает среды обучения с подкреплением из реализованной функциональности в репозиториях открытого исходного кода, используя исходный код в качестве единственного входа. Метод распределяет агентные вычислительные ресурсы для исследования функциональности, создания тестов, основанных на исполнении, и валидации задач через повторяющиеся проходы, что приводит к формированию набора данных из 5 545 обучающих задач по 23 языкам программирования. Обучение MiMo-V2.5 на этих задачах с использованием GRPO улучшает показатели на пяти разнообразных бенчмарках, включая DeepSWE (+11,7%), ProgramBench (+17%) и Terminal-Bench v2.1 (+8,5%). Анализ траекторий показывает, что агент, обученный методом RL, демонстрирует лучшее поведение, такое как более активное исследование кодовой базы и более разнообразная самопроверка. Эти результаты устанавливают исходный код в качестве масштабируемой основы для создания сред RL, улучшающих работу агентов программирования при решении различных задач в области программного обеспечения.

arxiv arXiv cs.CL · 2 д назад · 10 просмотров

TrialAtlas: многоагентная система улучшает оценку рисков при проектировании клинических испытаний

Исследователи представили TrialAtlas, организацию для исследований с расширенной памятью на основе нескольких агентов, предназначенную для помощи в планировании клинической разработки (CDP). Система координирует специализированные агенты для синтеза литературы, конкурентной разведки и регуляторного анализа, чтобы прогнозировать риски разработки.

media Hugging Face Forums · 2 д назад · 18 просмотров

MB-Bidram делится экспериментальной архитектурой WideNDepth, разделяющей рассуждение и знания

MB-Bidram выпустила экспериментальную нейронную архитектуру под названием WideNDepth (WND), предназначенную для разделения способностей к рассуждению и хранения знаний. Модель состоит из «Wide части», которая функционирует как память, и «Depth части», которая действует как механизм рассуждения.

media Hugging Face Forums · 3 д назад · 16 просмотров

Исследователь ищет одного независимого аннотатора для разрешения неоднозначности согласия LLM

Исследователь просит одного независимого человеческого аннотатора разметить 100 турецких нарративных сцен, чтобы определить, обусловлено ли низкое межрейтерское согласие интерпретационной природой задачи или нечёткими определениями аннотации. Исследование показало, что четыре LLM и детектор на основе правил согласовывались друг с другом и человеческим эталоном примерно на уровне случайного угадывания, при этом значения κ Коэна варьировались от 0.000 до 0.185.

media Hugging Face Forums · 3 д назад · 17 просмотров

GlucoEdge: прогнозирование тренда уровня глюкозы на устройстве с INT8-квантованием

Исследователь-фрилансер Мохамед Менаси опубликовал GlucoEdge — инженерное исследование, подробно описывающее конвейер машинного обучения для выполнения задач непосредственно на устройстве. Система предназначена для прогнозирования тренда уровня глюкозы по пяти классам с шагом 15 минут на основе данных непрерывного мониторинга глюкозы. В работе представлена компактная 1D CNN, содержащая всего 2909 параметров, и охвачен полный рабочий процесс от PyTorch до конвертации в LiteRT.

media Hugging Face Forums · 3 д назад · 18 просмотров

Предложение: прогрессивная передача знаний от Qwen 9B к 27B для фиксированной модели на 4B

Пользователь на форумах Hugging Face предлагает эксперимент по прогрессивной передаче знаний, в котором студентская модель фиксированного размера (Qwen 4B) последовательно обучается у всё более крупных моделей-учителей, а не напрямую у самой большой из доступных.

media Hugging Face Forums · 4 д назад · 32 просмотра

Обзор литературы показывает слабую корреляцию между экономией от сжатия и измеренным энергопотреблением

Независимый исследователь опубликовал обзор литературы, анализирующий, снижают ли методы сжатия моделей, такие как квантование, прунинг и дистилляция, фактически измеряемое энергопотребление или лишь уменьшают количество FLOPs.

lab NVIDIA Research · 7 д назад · 19 просмотров

Human2Any: передача от человека роботу через композиционное планирование с учётом ограничений

В статье представлена Human2Any — метод передачи от человека роботу, использующий композиционное планирование с учётом ограничений. Дополнительные сведения или основной текст в источнике не приведены.

arxiv arXiv cs.LG · 7 д назад · 20 просмотров

OpenAI выпустила Open-1B с полностью проверяемым процессом обучения

OpenAI выпустила Open-1B, языковую модель, обученную в условиях, при которых каждая операция во время обучения может быть независимо воспроизведена на разнородном стандартном оборудовании с битовой точностью. Этот подход решает проблемы воспроизводимости, присущие моделям с открытым исходным кодом, путем установления строгого порядка для источников недетерминизма, таких как редукция GPU-ядер и порядок формирования пакетов данных.

arxiv arXiv cs.AI · 8 д назад · 24 просмотра

Предварительная версия Atria Dawn: базовая агентная языковая модель для научных исследований

Предварительная версия Atria Dawn представляет собой базовую агентную языковую модель, предназначенную для научных исследований и инженерных рабочих процессов, обученную с помощью конвейера проверяемого опыта, который связывает опосредованные инструментами взаимодействия с исполняемыми средами. По 16 бенчмаркам, охватывающим реальные исследования, инженерию и цифровую работу, модель конкурентоспособна с передовыми агентами и достигает наивысшего зафиксированного результата в пяти из них.