Источник · arXiv cs.LG
arxiv arXiv cs.LG · 12 д назад · 2 просмотра

Moonshot AI выпустила Kimi K3: MoE-модель с 2,8 трлн параметров и контекстом в миллион токенов

Moonshot AI представила Kimi K3 — модель Mixture-of-Experts с открытым исходным кодом, имеющую 2,8 триллиона общих параметров и 104 миллиарда активных параметров на токен. Модель поддерживает нативные возможности работы с визуальными данными и контекстное окно в миллион токенов, используя Kimi Delta Attention и Stable LatentMoE для достижения примерно 2,5-кратной эффективности масштабирования по сравнению с предыдущей версией Kimi K2.

arxiv arXiv cs.LG · 2 д назад

U-OPSD позволяет проводить неконтролируемую самодистилляцию на основе текущей политики для больших языковых моделей

Исследователи предлагают метод неконтролируемой самодистилляции на основе текущей политики (U-OPSD), который обеспечивает улучшение после дообучения больших языковых моделей исключительно за счёт собственных генераций модели без внешнего контроля. Подход выбирает несколько последовательностей для построения псевдорешения с помощью большинства голосов, а затем дистиллирует распределение учителя в префиксы самого длинного неверного завершения модели.

arxiv arXiv cs.LG · 5 д назад OSWorld 2.0 · 21.2% · 6 просмотров

Qwen выпускает Qwen-CUA, нативного агента для управления компьютером на архитектуре 397B-A17B

Qwen представляет Qwen-CUA — нативного агента для управления компьютером, построенного на основе модели mixture-of-experts объёмом 397B-A17B. Агент работает через скриншоты и события ввода, не опираясь на DOM-деревья или метаданные доступности. Система использует каркас (scaffold) для хранения до 20 активных скриншотов и обучалась с помощью облачного флота развёртывания, насчитывающего почти 100 000 виртуальных процессорных ядер на примерно 40 000 проверяемых задач.

arxiv arXiv cs.LG · 18 д назад · 4 просмотра

SkewAdam использует многоуровневое состояние оптимизатора для снижения памяти при обучении MoE на 97%

Исследователи представляют SkewAdam — оптимизатор, разработанный для моделей mixture-of-experts (MoE), который распределяет различные типы состояния среди разных групп параметров, чтобы радикально сократить использование памяти. Назначая импульс float32 и факторизованные вторые моменты для основной сети, факторизованные вторые моменты для экспертов и точные вторые моменты для маршрутизатора, SkewAdam уменьшает состояние оптимизатора с 50.6 ГБ до 1.29 ГБ для модели с 6.78B параметров.

arxiv arXiv cs.LG · 23 д назад · 2 просмотра

RoboTTT масштабирует политики роботов до контекста в 8 тысяч шагов по времени

Исследователи представляют RoboTTT, рецепт обучения, который расширяет визуомоторный контекст для фундаментальных моделей роботов до 8000 шагов по времени без увеличения задержки вывода. Метод интегрирует обучение во время тестирования в политики Vision-Language-Action с использованием быстрых весов, обновляемых посредством градиентного спуска как во время обучения, так и при выводе.

arxiv arXiv cs.LG · 24 д назад BrowseComp · 42.6% · 1 просмотр

TRACE улучшает долгосрочное использование инструментов агентами через оценку кредита на уровне шагов

Авторы предлагают TRACE (Turn-level Reward Assignment via Credit Estimation), метод плотного распределения кредита для агентного обучения с подкреплением, который решает проблему разреженности и высокой дисперсии наград за результат в задачах с длинным горизонтом. Представляя прогнаты как переходы состояний на границах вызовов инструментов и выводя награды за каждое действие из логарифмического отношения значений состояний, TRACE позволяет эффективно обучать модель без дополнительных критиков или этапов супервизированного дообучения.

arxiv arXiv cs.LG · 25 д назад

TerraZero: процедурный симулятор вождения обеспечивает масштабное обучение с нуля без демонстраций

Исследователи представляют TerraZero, процедурный симулятор вождения и стек обучения методом self-play, предназначенный для обучения надежных агентов автономного вождения без человеческих демонстраций. Система использует настраиваемый движок C для выполнения симуляции на CPU и вывода политик на GPU по пути с нулевым копированием, обеспечивая 1,3 млн шагов агента в секунду на одном серверном GPU.

arxiv arXiv cs.LG · 25 д назад

REGRIND учится ловкому манипулированию по одной демонстрации человека

Авторы представляют REGRIND, минималистичный конвейер обучения с подкреплением, направляемый ретаргетингом, который учит политики ловкого манипулирования на основе одной демонстрации человеком. Метод переносит движение руки человека и объекта на эталонные данные робота, сохраняя пространственные и контактные взаимосвязи, а затем обучает остаточную политику RL в симуляции для отслеживания ключевых точек, связанных с объектом.

arxiv arXiv cs.LG · 26 д назад AIME 2025 · 92.7% · 5 просмотров

Mach-Mind-4-Flash: 35B MoE agentic модель сопоставима с более крупными моделями благодаря оптимизации после обучения

Технический отчет Mach-Mind-4-Flash представляет собой 35B-параметрическую Mixture-of-Experts (MoE) agentic модель с активированными параметрами всего в 3B. Благодаря исключительно оптимизации после обучения модель достигает производительности, сопоставимой с моделями класса 100B параметров или превосходящей их, без увеличения вычислений при предварительном обучении.

arxiv arXiv cs.LG · 26 д назад · 1 просмотр

Deutsche Telekom выпустила Soofi S 30B-A3B, открытую MoE-модель для немецкого и английского языков

Deutsche Telekom выпустила Soofi S 30B-A3B, суверенную, открытую гибридную модель Mixture-of-Experts на основе Mamba Transformer, предназначенную для немецкого и английского языков. Модель построена с нуля в облаке German Industrial AI Cloud и активирует только 3 миллиарда из своих 30 миллиардов параметров на токен, чтобы поддерживать почти постоянный кэш вывода при увеличении контекста.

arxiv arXiv cs.LG · 24 д назад

Улучшенная граница смешивания случайного процесса Дикана с d^2.5 до d^2.25

Исследователи улучшили границу сходимости для случайного процесса Дикана, метода равномерной выборки из многогранников, вдохновленного методами внутренней точки. Новое доказательство показывает, что использование масштабированного метрического пространства Ли-Сидфорда сокращает время смешивания с $d^{2.5}$ до $d^{2.25}$ итераций.

arxiv arXiv cs.LG · 24 д назад

Мультимодальный эмпирический байесовский VAE для совместного моделирования лонгитюдных данных и времени до события

Авторы расширяют框架 эмпирического байесовского вариационного автокодировщика (EB-VAE) для совместного моделирования лонгитюдных измерений опухоли и данных о выбывании по времени до события. Подход использует априорное распределение, обусловленное ковариатами, для представления межличностной изменчивости и дополняет декодер моделью риска для учета информативного выбывания.

arxiv arXiv cs.LG · 24 д назад · 1 просмотр

Показатель Ляпунова как физически обоснованная плотная награда: открытие методов стабилизации в RL за пределами маятника Капицы

Авторы предлагают использовать показатель Ляпунова (LCE) в качестве сигнала плотной награды для стабилизации перевёрнутого маятника с вертикальным движением. Этот подход позволяет агентам обучения с подкреплением обнаруживать сложные поведения стабилизации, выходящие за рамки стандартных осцилляторных решений.

arxiv arXiv cs.LG · 24 д назад · 2 просмотра

Lighthouse RL вводит стратегические точки сброса для экономии образцов при настройке аналоговых схем

Исследователи представляют Lighthouse RL, подход к обучению с подкреплением, который повышает эффективность использования образцов при настройке аналоговых схем за счёт использования высокопроизводительных конфигураций в качестве стратегических точек сброса.

arxiv arXiv cs.LG · 24 д назад Terminal-Bench · 76.4%

Оптимизация RELAI-VCL показывает лучшие результаты на Terminal-Bench 2.0

Исследование оценивает, накапливаются ли преимущества оптимизации агентов с течением времени путем тестирования трех методов — GEPA, Meta Harness и RELAI-VCL — на сложных задачах Terminal-Bench 2.0. Хотя все методы превосходят статическую базовую линию, только RELAI-VCL успешно переносится на невидимые задачи и продолжает улучшаться после последующих раундов оптимизации.

arxiv arXiv cs.LG · 24 д назад

Дизайн блока прямой передачи трансформера сохраняет ранг градиента по глубине

В статье исследуется, как компоненты архитектуры блока прямой передачи трансформера определяют количество ранга, сохраняющегося на всех слоях при инициализации. В работе переосмысливаются остаточные связи (skip connections) и нормализация как механизмы сохранения ранга градиента, который в противном случае снижается из-за матричных умножений и нелинейных активаций.

arxiv arXiv cs.LG · 24 д назад

CSFS снижает стоимость отбора признаков для прогнозирования ветровой и солнечной энергии на 21%

Исследователи предлагают кластеризационный последовательный отбор признаков (CSFS), новый обёрточный метод на основе кластеризации для автоматического и эффективного отбора признаков в конвейерах прогнозирования возобновляемой энергии. Этот подход решает проблему отсутствия систематических методов для выбора входных признаков из большого количества доступных переменных мониторинга и окружающей среды.

arxiv arXiv cs.LG · 24 д назад · 1 просмотр

Исследование показывает, что внедрение агентных инструментов для программирования низкое и сосредоточено в небольших проектах GitHub

Недавний анализ 25 264 агентных pull-запросов в 2 361 популярных репозиториях GitHub показывает, что интенсивное использование агентных инструментов для программирования остается ограниченным небольшой частью проектов с открытым исходным кодом. Исследование указывает, что медианный репозиторий генерирует всего один или два таких PR за трехмесячный период.

arxiv arXiv cs.LG · 24 д назад · 1 просмотр

Маршрутизация с участием нескольких экспертов для мультисубъектного OCR с низким уровнем ресурсов: исследование на маньчжурском языке

В статье представлена система с несколькими экспертами для исторического маньчжурского OCR, которая обрабатывает визуально различимые стили письма, такие как регулярный шрифт, курсив и полукursive канцелярский почерк, несмотря на ограниченное количество размеченных данных. Подход повторно использует контрольные точки из процесса итеративного дообучения в качестве специалистов по доменам и использует легкий классификатор изображений на уровне страницы для маршрутизации страниц на основе визуального стиля.

arxiv arXiv cs.LG · 24 д назад

Зонды Evo 2 обнаруживают устойчивость к антимикробным препаратам в метагеномных данных с высокой точностью

Исследователи оценили потенциал биобезопасности фундаментальных геномных моделей, обучив линейные и внимательные зонды на замороженных активациях слоя 26 Evo 2 для скрининга устойчивости к антимикробным препаратам (AMR) в метагеномных данных. Исследование показало, что эти легкие зонды могут обнаруживать AMR с сильной дискриминацией, достигая ROC-AUC на уровне региона 0,977 с использованием зонда с однократным вниманием.