Источник · arXiv cs.AI
arxiv arXiv cs.AI · 3 д назад SWE-bench Pro · 78.0%

Argus: Универсальная агентная среда выполнения для рассуждений на длительных горизонтах

Исследователи представляют Argus — постоянную, самоэволюционирующую агентную среду выполнения, предназначенную для рассуждений на длительных горизонтах, которая разделяет стабильные намерения пользователя и операционные цели. Система использует роли Manager, Planner, Engineer и Reviewer для выполнения ограниченных миссий в условиях долговременного состояния проекта, что позволяет осуществлять автономное выполнение между точками эскалации, контролируемыми оператором.

arxiv arXiv cs.AI · 3 д назад

SciCode-Verified исправляет дефекты бенчмарка, чтобы выявить истинную способность моделей к научному программированию

Авторы выявляют, что застой показателей на бенчмарке SciCode обусловлен существенными дефектами инструмента оценки, а не ограничениями возможностей моделей. Аудит 65 тестовых задач экспертами в предметной области выявил 263 дефекта, из которых 192 приводили к неверному отклонению правильных решений из-за таких проблем, как невозможность воспроизведения эталонных ответов и чрезмерно жесткие допуски.

arxiv arXiv cs.AI · 4 д назад

Video-DeepResearch представляет мультимодального агента для непрерывных видеопотоков

Исследователи представляют Video-DeepResearch (Video-DR), фреймворк, расширяющий возможности мультимодальных агентов со статических изображений на непрерывные видеопотоки, решая проблемы модальности и утечки параметрических знаний. Система использует разделенный конвейер восприятия и исследования с поэтапным разблокированием инструментов для обеспечения перекрестного визуального обоснования между кадрами перед поиском в веб-сети.

arxiv arXiv cs.AI · 9 д назад WebArena · 73.6% · 2 просмотра

Qwen-UI-Agent устанавливает новый стандарт на бенчмарках мобильного использования

Команда Qwen выпустила технический отчёт по Qwen-UI-Agent, фундаментальному агенту графического интерфейса, ориентированному на реальные сценарии и предназначенному для надёжной работы в средах мобильных устройств, компьютерного использования, веб-интерфейсов и DeepSearch. Система объединяет разнообразные среды песочницы с крупномасштабным мобильным рантаймом на реальных устройствах, чередуя операции GUI с выполнением CLI и поддерживая задачи с длительным горизонтом.

arxiv arXiv cs.AI · 12 д назад · 1 просмотр

ClinFusion представляет собой MLLM с акцентом на зрение для комплексного медицинского понимания

Исследователи представляют ClinFusion, мультимодальную большую языковую модель с акцентом на зрение, разработанную для решения проблем внедрения ИИ в клиническую практику путем объединения понимания 2D и 3D медицинских изображений. Система включает композиционный каскадный визуальный энкодер с оператором каскадного пространственно-ориентированного локального слияния и новый фреймворк оценки, включающий MedIF-Bench и метрики, основанные на области интереса.

arxiv arXiv cs.AI · 12 д назад

Модуль проверки соответствия Aethis использует нейро-символическую архитектуру для исправления ошибок оценки правил LLM

В статье описывается класс сбоев во фронтальных больших языковых моделях, называемый коллапсом цепочки исключений, при котором модели неверно оценивают вложенные условные правила. Для решения этой проблемы авторы представляют Модуль проверки соответствия Aethis — нейро-символическую архитектуру, которая объединяет правила, созданные LLM, со слоем на основе SMT для детерминированного выполнения.

arxiv arXiv cs.AI · 16 д назад OSWorld · 37.7% · 5 просмотров

OpenForgeRL позволяет проводить сквозное обучение агентов на основе хабров в любой среде

OpenForgeRL — это фреймворк с открытым исходным кодом, который позволяет исследователям обучать агентов ИИ на основе хабров от начала до конца с использованием стандартных стеков обучения с подкреплением. Это достигается за счёт разделения процессов обучения и вывода через лёгкий прокси-сервер, который записывает вызовы модели как данные, и оркестратора Kubernetes, управляющего удалённым развёртыванием контейнеров.

arxiv arXiv cs.AI · 16 д назад · 4 просмотра

AREX представляет рекурсивно самоусовершенствующихся агентов глубокого исследования

Исследователи представляют AREX, семейство рекурсивно самоусовершенствующихся (RSI) агентов глубокого исследования, предназначенных для решения асимметрии между обнаружением и проверкой в сложных запросах. AREX чередует внутренний цикл, собирающий доказательства и формирующий предварительные ответы, с внешним циклом, проверяющим ограничения для направленного уточнения.

arxiv arXiv cs.AI · 17 д назад · 4 просмотра

SLAI T-Rex позволяет проводить полное параметрическое постобучение модели DeepSeek-V4 на платформе Ascend SuperPOD

SLAI представляет T-Rex — сквозную оптимизационную платформу для полного параметрического постобучения моделей MoE триллионного масштаба на суперкластере NPU Ascend. Используя семейство моделей DeepSeek-V4 в качестве целевой нагрузки, система решает проблемы с памятью и накладными расходами на коммуникацию за счёт иерархического параллелизма и оптимизации выполнения ядер.

arxiv arXiv cs.AI · 17 д назад Humanity's Last Exam · 49.92% · 1 просмотр

PoTRE представляет гетерогенную многоагентную архитектуру для рассуждений во время тестирования

Авторы представляют PoTRE (Poly-Topological Reasoning Ensembles), архитектуру, предназначенную для преодоления ограничений стандартного однопоточного промптинга в сложных задачах рассуждения. PoTRE разделяет процесс вывода на четыре отдельных агента: агент состязательного уточнения, иерархический агент стратегического планирования, агент поиска спектра и агент прямой цепочки.

arxiv arXiv cs.AI · 18 д назад

ISO представляет нативный стек оптимизации для RLVR, исправляющий спектры весов моделей

Исследователи предлагают Isospectral Optimization (ISO), фреймворк для обучения с подкреплением по верифицируемым наградам (RLVR), который устраняет недостающий слой оптимизации за счёт фиксации спектров весов модели при оптимизации входных и выходных сингулярных кадров.

arxiv arXiv cs.AI · 23 д назад

RoboTTT масштабирует политики роботов до контекста в 8 тысяч шагов

NVIDIA представляет RoboTTT, фундаментальную модель для роботов и рецепт обучения, который расширяет визуомоторный контекст до 8000 шагов без увеличения задержки вывода. Интегрируя обучение во время тестирования (Test-Time Training) в политики Vision-Language-Action, система сжимает историю в пространстве весов с использованием быстрых весов, обновляемых методом градиентного спуска.

arxiv arXiv cs.AI · 23 д назад SWE-bench Pro · 63.2%

Xiaomi выпустила U0, модель с 38 миллиардами параметров для унифицированного воплощённого синтеза

Xiaomi представила Xiaomi-Robotics-U0, мультимодальную авторегрессионную модель с 38 миллиардами параметров, предназначенную для унифицированного воплощённого синтеза. Модель рассматривает воплощённую генерацию как расширение базовой генерации изображений и видео, совместно оптимизируя генерацию текста в изображение, редактирование изображений, генерацию воплощённых сцен, воплощённый перенос и генерацию воплощённого видео.

arxiv arXiv cs.AI · 23 д назад · 1 просмотр

RAGU представляет многоэтапный движок GraphRAG с компактным экстрактором Meno-Lite-0.1

RAGU — это модульный движок GraphRAG с открытым исходным кодом, который улучшает интеграцию структурированных знаний за счёт разделения извлечения сущностей и их консолидации. Он использует двухэтапный процесс типизированного извлечения, дедупликацию на базе DBSCAN, суммаризацию LLM и обнаружение сообществ по алгоритму Leiden для снижения уровня шума и хрупкости, характерных для однопроходных систем.

arxiv arXiv cs.AI · 25 д назад

TerraZero позволяет проводить обучение self-play без демонстраций со скоростью 1,3 млн шагов/сек

Исследователи представляют TerraZero, процедурный симулятор вождения и стек обучения методом self-play, предназначенный для обучения устойчивых агентов автономного вождения без использования человеческих демонстраций. Система выполняет симуляцию на CPU и инференс политики на GPU по пути с нулевым копированием, поддерживая 1,3 миллиона шагов агента в секунду на одном серверном GPU.

arxiv arXiv cs.AI · 26 д назад

Deutsche Telekom выпустила Soofi S 30B-A3B для немецкого и английского языков

Deutsche Telekom выпустила Soofi S 30B-A3B, суверенную модель с открытым исходным кодом типа Mixture-of-Experts, оптимизированную для немецкого и английского языков. Модель, созданная на базе German Industrial AI Cloud, активирует только 3 миллиарда из своих 30 миллиардов параметров на токен, чтобы поддерживать почти постоянный кэш вывода при увеличении контекста.

arxiv arXiv cs.AI · 27 д назад

ProofCouncil: агент LLM для решения открытых математических задач

Исследователи представляют ProofCouncil, агента на базе LLM, предназначенного для решения открытых математических проблем с использованием архитектуры автор-критик. Система была представлена как участие во втором наборе FirstProof — конкурсе, включающем 10 реальных математических задач, которые агенты должны решать автономно.

arxiv arXiv cs.AI · 27 д назад

За пределами фиксированных представлений: Пробелы в словаре и верификаторе для открытого ИИ

В этой статье утверждается, что создание более мощных интеллектуальных систем, способных к открытым инновациям, требует создания, стабилизации и повторного использования новых репрезентативных примитивов, а не просто поиска в рамках фиксированных структур.

arxiv arXiv cs.AI · 23 д назад

HealthClaw: агент с открытым исходным кодом и самообучающейся памятью для долгосрочного управления личным здоровьем

Исследователи разработали HealthClaw, архитектуру агента с открытым исходным кодом, предназначенную для обновления поддержки по мере изменения привычек, предпочтений, показателей и рисков человека со временем. Она разделяет общие правила безопасности и медицинские знания от частной долговременной памяти, содержащей факты профиля, повторно используемые процедуры и эпизодические следы.

arxiv arXiv cs.AI · 24 д назад · 2 просмотра

Генерация танца по музыке через атомарные движения

Исследователи представляют структуру-осознанный фреймворк для музыки-управляемой генерации танца, который моделирует хореографию как последовательность атомарных движений, а не непрерывных сигналов.