Источник · NVIDIA Research
lab NVIDIA Research · 17 ч назад · 7 просмотров

Symphony оркеструет разреженные и плотные тензоры с помощью иерархической гетерогенной обработки

В статье предлагается Symphony, гибридная программируемая и специализированная архитектура, предназначенная для устранения неэффективностей системы памяти в современных высокопроизводительных архитектурах, таких как GPU. Она сосредоточена на оркестровке данных через иерархию памяти для сокращения ненужного перемещения данных и расстояния.

lab NVIDIA Research · 6 д назад · 23 просмотра

HorizonRelight использует маскированное самовоздействие для согласованного переосвещения видео на длительных временных отрезках

Исследователи решают проблему временных разрывов при переосвещении длинных видеороликов, переформулируя задачу как перевод латентной области с временным условием. Фреймворк обеспечивает непрерывность между фрагментами путем распространения латентов целевой области через границы и использует маскированное самовоздействие в целевой области, чтобы сделать это поведение обучаемым.

lab NVIDIA Research · 6 д назад · 28 просмотров

Nvidia представляет FusionRelight для перенастройки освещения портретов в реальном времени посредством слияния гибридных предметных знаний

Исследователи из Nvidia представили FusionRelight — метод перенастройки освещения портретов, сочетающий физически правдоподобный перенос освещения с сохранением идентичности и компактным выводом в реальном времени. Подход использует Гибридное Слияние Предметных Знаний (HDKF), фреймворк обучения, который дистиллирует априорные знания о физике, отражательной способности и реализме из синтетических данных, данных One-Light-at-a-Time (OLAT) и естественных сцен в модель-студент.

lab NVIDIA Research · 9 д назад · 61 просмотр

LLM соответствуют или превосходят байесовскую оптимизацию в гиперпараметрической оптимизации

Новая статья исследует использование фундаментальных больших языковых моделей (LLM) для автоматизации гиперпараметрической оптимизации (HPO), процесса, который обычно полагается на ручные подходы в условиях ограниченного бюджета. Авторы разработали методологию, в которой LLM предлагают конфигурации гиперпараметров на основе описаний набора данных и модели, которые затем итеративно уточняются в соответствии с производительностью модели.

lab NVIDIA Research · 9 д назад · 56 просмотров

Источник представляет приближённое развёрнутое дифференцирование для атрибуции обучающих данных

Исследователи представляют Source, новый метод атрибуции обучающих данных (TDA), который сочетает вычислительную эффективность функций влияния с точностью подходов на основе развёртывания. Используя формулу, подобную функции влияния, для аппроксимации развёрнутого дифференцирования, Source устраняет ограничения методов неявного дифференцирования, такие как их неспособность учитывать смещение оптимизации или многоэтапные конвейеры.

lab NVIDIA Research · 9 д назад · 34 просмотра

NVIDIA выпустила модель генерации мира в реальном времени OmniDreams для симуляции автономных транспортных средств

NVIDIA представила OmniDreams, базовую генеративную модель мира, предназначенную для устранения узких мест при оценке политик автономного вождения в замкнутых циклах симуляций. Обученная на 21 тысяче часов сценариев вождения после промежуточного и финального этапов на основе модели диффузии Cosmos, она авторегрессионно генерирует видео, обусловленные действиями, в реальном времени.

lab NVIDIA Research · 9 д назад · 25 просмотров

JacNet учит функции путём прямого моделирования структурированных якобианов

В статье представлена JacNet, архитектура нейронной сети, которая напрямую обучает якобиан входно-выходной функции, а не само отображение. Этот подход позволяет точно контролировать свойства производных, обеспечивая соблюдение структурных априорных знаний, таких как обратимость и k-липшицева непрерывность.

lab NVIDIA Research · 9 д назад · 31 просмотр

jlorraine представляет масштабируемые инструменты вложенной оптимизации для глубокого обучения

В статье представлена диссертация jlorraine, которая решает проблемы применения двухуровневой или вложенной оптимизации к крупномасштабным настройкам глубокого обучения. В то время как градиентная оптимизация обычно обновляет один набор параметров, во многих приложениях требуется обновление подмножеств параметров по различным целям, вложенным друг в друга.

lab NVIDIA Research · 10 д назад · 30 просмотров

Masters дистиллирует зрительно-языковые модели через маскирование учителя и подкрепление студента

Исследователи предлагают Masters, фреймворк прогрессивного обучения с подкреплением на основе маскирования для дистилляции крупномасштабных зрительно-языковых моделей в компактные версии, подходящие для развертывания на периферийных устройствах. Метод решает проблему нестабильности, вызванной разрывом в размерах между моделями учителя и студента.

lab NVIDIA Research · 10 д назад · 36 просмотров

DSTP устраняет сбои при отсечении визуальных токенов в сложных задачах рассуждения MLLM

Исследователи выявили сдвиг релевантной визуальной информации (RVIS) во время декодирования как основную причину отказа существующих методов отсечения визуальных токенов в мультимодальных больших языковых моделях (MLLM). Для решения этой проблемы они предлагают метод Decoding-stage Shift-aware Token Pruning (DSTP), не требующий обучения, который согласовывает визуальные токены с меняющимися требованиями рассуждения.

lab NVIDIA Research · 10 д назад · 26 просмотров

GenRecal дистиллирует крупные модели зрения и языка в мелкие посредством перекалибровки

Исследователи представляют GenRecal, универсальную фреймворк дистилляции, который передаёт знания от крупных моделей зрения и языка (VLM) к более мелким и эффективным аналогам. Метод решает проблему гетерогенных архитектур VLM с помощью Перекалибратора для выравнивания и адаптации представлений признаков между различными типами моделей.

lab NVIDIA Research · 10 д назад · 28 просмотров

ZPPO использует промпты вместо градиентов для улучшения обучения малых зрительно-языковых моделей

Исследователи представляют Зону Проксимальной Оптимизации Политики (ZPPO), метод, который внедряет знания учителя в промпты, а не в градиенты политики, чтобы устранить хрупкость при дистилляции знаний и дрейф в обучении с подкреплением. ZPPO формирует Бинарные Вопросы с Включённым Кандидатом (BCQ) и Негативные Вопросы с Включённым Кандидатом (NCQ) для сложных вопросов, повторно используя их через буфер воспроизведения до тех пор, пока точность студента не улучшится или они не будут исключены.

lab NVIDIA Research · 10 д назад · 21 просмотр

Hide to See представляет маскирование префикса рассуждения для дистилляции VLM

Исследователи предлагают новую фреймворк дистилляции «мышление-ответ», который улучшает способность компактных зрительно-языковых моделей использовать визуальные доказательства путем маскирования значимых префиксов рассуждения. Этот подход решает проблему «визуального забывания», распространенную в длинных треках «мышление-ответ», где студенты теряют фокус на визуальных подсказках во время расширенного рассуждения.

lab NVIDIA Research · 10 д назад · 15 просмотров

SpatialClaw использует код как интерфейс действий для агентного пространственного рассуждения

Исследователи предлагают SpatialClaw, фреймворк без обучения, который использует код в качестве интерфейса действий для улучшения открытого пространственного рассуждения 3D и 4D в моделях «зрение-язык». В отличие от существующих агентов, полагающихся на однократное выполнение или жесткие вызовы инструментов, SpatialClaw поддерживает состоящее ядро Python, предварительно загруженное входными кадрами и примитивами восприятия.

lab NVIDIA Research · 10 д назад · 27 просмотров

AXPO улучшает мультимодальное агентное рассуждение, устраняя разрыв между мышлением и действием

Исследователи предлагают метод Agent Explorative Policy Optimization (AXPO) для устранения «разрыва между мышлением и действием» в моделях зрения-языка, требующих внешних инструментов. Этот разрыв приводит к тому, что стандартные методы RL, такие как GRPO, пытаются использовать инструменты только в ~30% эпизодов, при этом высокие показатели неудач подавляют обучающие сигналы.

lab NVIDIA Research · 15 д назад · 36 просмотров

ROSA повышает производительность фабрики до 12,06x за счёт обслуживания через общий пул GPU

Исследователи предлагают ROSA, систему обслуживания базовой модели робототехники, предназначенную для роботизированных фабрик и выходящую за рамки предположений об обслуживании отдельных роботов на периферийных вычислениях. Система использует обслуживание через общий пул GPU, позволяя флотам роботов получать доступ к серверным GPU по сети.

lab NVIDIA Research · 24 д назад · 28 просмотров

NVIDIA представляет Spatial-IQ: иерархическую диагностическую систему для пространственного мышления мультимодальных моделей

Исследователи NVIDIA представили Spatial-IQ — диагностическую систему, предназначенную для деконструкции пространственного интеллекта мультимодальных больших языковых моделей (MLLMs). В отличие от существующих бенчмарков, которые рассматривают модели как чёрные ящики, этот подход разбивает подсчёт объектов в стопках 3D-структур на девять перцептивных и когнитивных подзадач, согласованных с этапами человеческого развития.

lab NVIDIA Research · 24 д назад · 38 просмотров

Кластеризованная кодовая книга для сжатия изображений на основе 2D Гауссиан

Исследователи представляют Cluster-Guided Vector Quantization (CGVQ), метод, разработанный для улучшения показателей rate-distortion в сжатии изображений на основе гауссовых примитивов. Подход разделяет параметры Гаусса на однородные группы перед квантованием, устраняя неэффективность, вызванную хранением большого количества параметров с плавающей запятой для каждого примитива.

lab NVIDIA Research · 24 д назад · 25 просмотров

Мультимодальный ИИ-анализ невербальной коммуникации в Delta Force

Исследователи анализируют видео игрового процесса соревновательного шутера Delta Force, чтобы извлечь и понять возникающую невербальную коммуникацию, такую как жесты и паттерны перемещения. Эта работа восполняет пробел в предыдущих исследованиях, которые в значительной степени фокусировались на MOBA-играх или вербальной координации в других шутерах.

lab NVIDIA Research · 24 д назад · 19 просмотров

Исследователи NVIDIA предлагают провести полевые эксперименты на турнирах по Rocket League

Исследователи NVIDIA решают проблему сложного планирования конкурентной групповой игры и воссоздания лабораторных условий, внедряя методологию полевых экспериментов. Этот подход интегрирует эксперименты непосредственно в структуру турниров, создавая гибридные турниры-эксперименты.