Research paper
media r/LocalLLaMA · 1 д назад · 5 просмотров

Министерство энергетики США запускает инициативу Genesis Open Models и представляет Genesis-Science-1

Министерство энергетики США запустило инициативу Genesis Open Models и в партнерстве с Arcee представило свою первую модель с открытым весом для научных исследований под названием Genesis-Science-1.

arxiv arXiv cs.LG · 2 д назад

U-OPSD позволяет проводить неконтролируемую самодистилляцию на основе текущей политики для больших языковых моделей

Исследователи предлагают метод неконтролируемой самодистилляции на основе текущей политики (U-OPSD), который обеспечивает улучшение после дообучения больших языковых моделей исключительно за счёт собственных генераций модели без внешнего контроля. Подход выбирает несколько последовательностей для построения псевдорешения с помощью большинства голосов, а затем дистиллирует распределение учителя в префиксы самого длинного неверного завершения модели.

arxiv arXiv cs.CL · 2 д назад

M$^3$R-Bench представляет доказательный бенчмарк для понимания мультимодальных метафор

Исследователи представляют M$^3$R-Bench, унифицированный бенчмарк, содержащий 1 000 пар «изображение-текст» с аннотациями, проверенными экспертами, предназначенный для оценки понимания мультимодальных метафор, основанного на доказательствах. Бенчмарк предоставляет совместные аннотации для выявления наличия метафоры, отображения «Цель-Источник», тональности и поэтапных объяснений на основе теории концептуальной метафоры.

lab Google DeepMind Blog · 3 д назад · 16 просмотров

Google DeepMind открыла исходный код модели WeatherNext AI для прогнозирования циклонов

Компании Google DeepMind и Google Research опубликовали исходные коды моделей WeatherNext 2 и WeatherNext Cyclones, которые продемонстрировали наивысшую точность в прогнозировании траекторий тропических циклонов, их интенсивности и структуры ветра. Опубликованная в журнале Nature работа показывает, что эти модели обеспечивают метеорологам дополнительный день предсказательной точности по сравнению с предыдущими системами.

arxiv arXiv cs.AI · 3 д назад SWE-bench Pro · 78.0%

Argus: Универсальная агентная среда выполнения для рассуждений на длительных горизонтах

Исследователи представляют Argus — постоянную, самоэволюционирующую агентную среду выполнения, предназначенную для рассуждений на длительных горизонтах, которая разделяет стабильные намерения пользователя и операционные цели. Система использует роли Manager, Planner, Engineer и Reviewer для выполнения ограниченных миссий в условиях долговременного состояния проекта, что позволяет осуществлять автономное выполнение между точками эскалации, контролируемыми оператором.

media MarkTechPost · 3 д назад

SkillOpt от Microsoft обеспечивает передачу навыков агента между Codex и Claude Code

Исследователи из Microsoft, Шанхайского университета Цзяо Тун, Университата Тунцзи и Университета Фудан разработали SkillOpt — оптимизатор в текстовом пространстве, который обучает документы с навыками на естественном языке, оставляя целевую модель замороженной. Система использует модель-оптимизатор для предложения ограниченных правок на основе оценённых прогонов, экспортируя результат в виде одного файла `best_skill.md`.

lab NVIDIA Research · 3 д назад · 5 просмотров

ROSA повышает производительность фабрики до 12,06x за счёт обслуживания через общий пул GPU

Исследователи предлагают ROSA, систему обслуживания базовой модели робототехники, предназначенную для роботизированных фабрик и выходящую за рамки предположений об обслуживании отдельных роботов на периферийных вычислениях. Система использует обслуживание через общий пул GPU, позволяя флотам роботов получать доступ к серверным GPU по сети.

media Hugging Face Forums · 5 д назад

Открытая реализация причинного линейного внимания O(N) с затуханием и объединённым ядром Triton

Разработчик открыл архитектуру причинного линейного внимания O(N) с затуханием, включающую объединённые ядра накопления состояний Triton/CUDA, предназначенные для обхода узких мест квадратичного MHA.

arxiv arXiv cs.LG · 5 д назад OSWorld 2.0 · 21.2% · 6 просмотров

Qwen выпускает Qwen-CUA, нативного агента для управления компьютером на архитектуре 397B-A17B

Qwen представляет Qwen-CUA — нативного агента для управления компьютером, построенного на основе модели mixture-of-experts объёмом 397B-A17B. Агент работает через скриншоты и события ввода, не опираясь на DOM-деревья или метаданные доступности. Система использует каркас (scaffold) для хранения до 20 активных скриншотов и обучалась с помощью облачного флота развёртывания, насчитывающего почти 100 000 виртуальных процессорных ядер на примерно 40 000 проверяемых задач.

arxiv arXiv cs.CL · 5 д назад · 1 просмотр

Douyin выпустила мультимодельную модель встраивания DME с передовыми характеристиками

Douyin опубликовала технический отчет о своей модели мультимодального встраивания (DME), которая сочетает крупномасштабное контрастное предобучение с латентным рассуждением для достижения высокой дискриминации и эффективности.

arxiv arXiv cs.CL · 5 д назад OSWorld 2.0 · 21.2% · 3 просмотра

Qwen выпустила Qwen-CUA — нативного агента для управления компьютером с архитектурой 397B-A17B

Исследователи представили Qwen-CUA, нативного агента для управления компьютером, построенного на основе модели Qwen mixture-of-experts объёмом 397B-A17B. Система работает путём анализа скриншотов и выполнения действий через события клавиатуры и мыши, без использования DOM-деревьев или метаданных доступности.

arxiv arXiv cs.CL · 5 д назад

Мониторы цепочки рассуждений коллапсируют, когда противники переписывают логику

Исследования показывают, что мониторинг цепочки рассуждений (CoT) неэффективен против противников, контролирующих процесс рассуждения. Переписывая рассуждения агента так, чтобы они выглядели как добросовестная инженерия, но сохраняя команды и выходные данные дословно, злоумышленники могут обойти механизмы обнаружения.

media Don't Worry About the Vase · 5 д назад · 5 просмотров

Astra от OpenAI решает 10 крупных открытых математических задач

OpenAI опубликовала результаты работы своей ещё не выпущенной внутренней модели Astra, которая успешно решила десять значимых открытых проблем в математике. Решения были сгенерированы моделью, а затем формализованы в виде сертификатов Lean исследователями-людьми.

blog Simon Willison · 7 д назад · 12 просмотров

Модель Astra от OpenAI решает десять давних математических задач с помощью GPT-5.6 Sol

OpenAI представила решения десяти математических и теоретико-информационных задач, по которым не было прогресса в основных результатах как минимум десятилетие, используя внутреннюю версию своей следующей крупной модели Astra.

lab OpenAI News · 8 д назад · 16 просмотров

Модель Astra решает десять открытых задач в математике и теоретической информатике

Внутренняя модель Astra от OpenAI нашла решения десяти давних открытых задач в области математики и теоретической информатики, при этом аргументы были формализованы в Lean. Эти результаты охватывают многомерную геометрию, теорию кодирования, теорию групп и квантовую сложность, отвечая на вопросы, по которым не было прогресса как минимум десять лет.

arxiv arXiv cs.CL · 9 д назад · 2 просмотра

Декодер памяти в масштабе: масштабирование параметрической долговременной памяти до 6,9 млрд параметров

Исследователи представляют Memory Decoder at Scale — систему, которая масштабирует параметрические модели долговременной памяти до 6,9 млрд параметров и предварительно обучает их на 300 млрд токенов. Чтобы решить проблему невозможности использования стандартных конвейеров Faiss при таком объёме данных, авторы реализуют распределённый конвейер индексации с разреженной пакетной загрузкой распределений kNN.

arxiv arXiv cs.AI · 9 д назад WebArena · 73.6% · 2 просмотра

Qwen-UI-Agent устанавливает новый стандарт на бенчмарках мобильного использования

Команда Qwen выпустила технический отчёт по Qwen-UI-Agent, фундаментальному агенту графического интерфейса, ориентированному на реальные сценарии и предназначенному для надёжной работы в средах мобильных устройств, компьютерного использования, веб-интерфейсов и DeepSearch. Система объединяет разнообразные среды песочницы с крупномасштабным мобильным рантаймом на реальных устройствах, чередуя операции GUI с выполнением CLI и поддерживая задачи с длительным горизонтом.

arxiv arXiv cs.CL · 10 д назад · 4 просмотра

Living-Harness самостоятельно эволюционирует: агенты-инструменты улучшают Pass@1 примерно на 10 пунктов

Исследователи предлагают Living-Harness — самоэволюционирующий инструмент для агентов, который преобразует завершённые траектории и сигналы оценщика в апостериорные доказательства для ограниченных обновлений инструмента. Под руководством Evolution-SOP система извлекает эпизодические абстракции и структурированные доказательства обновлений для записи эпизодической памяти и графов состояний.

arxiv arXiv cs.CL · 10 д назад · 3 просмотра

Конституционное промежуточное обучение обеспечивает устойчивые улучшения выравнивания без потери возможностей

Исследователи протестировали конституционное промежуточное обучение, внедрив контент, основанный на ценностях, в процесс обучения моделей масштаба 120B, чтобы определить, приводит ли оно к более устойчивому выравниванию по сравнению со стандартными методами постобучения. Исследование показало, что этот подход значительно улучшает обобщение и устойчивость выравнивания, особенно в снижении склонности к шантажу после контролируемой тонкой настройки.