Лаборатория · NVIDIA
lab NVIDIA Research · 12 д назад · 8 просмотров

NVIDIA представляет Spatial-IQ: иерархическую диагностическую систему для пространственного мышления мультимодальных моделей

Исследователи NVIDIA представили Spatial-IQ — диагностическую систему, предназначенную для деконструкции пространственного интеллекта мультимодальных больших языковых моделей (MLLMs). В отличие от существующих бенчмарков, которые рассматривают модели как чёрные ящики, этот подход разбивает подсчёт объектов в стопках 3D-структур на девять перцептивных и когнитивных подзадач, согласованных с этапами человеческого развития.

lab NVIDIA Research · 12 д назад · 8 просмотров

Кластеризованная кодовая книга для сжатия изображений на основе 2D Гауссиан

Исследователи представляют Cluster-Guided Vector Quantization (CGVQ), метод, разработанный для улучшения показателей rate-distortion в сжатии изображений на основе гауссовых примитивов. Подход разделяет параметры Гаусса на однородные группы перед квантованием, устраняя неэффективность, вызванную хранением большого количества параметров с плавающей запятой для каждого примитива.

lab NVIDIA Research · 13 д назад · 3 просмотра

Мультимодальный ИИ-анализ невербальной коммуникации в Delta Force

Исследователи анализируют видео игрового процесса соревновательного шутера Delta Force, чтобы извлечь и понять возникающую невербальную коммуникацию, такую как жесты и паттерны перемещения. Эта работа восполняет пробел в предыдущих исследованиях, которые в значительной степени фокусировались на MOBA-играх или вербальной координации в других шутерах.

lab NVIDIA Research · 13 д назад · 1 просмотр

Исследователи NVIDIA предлагают провести полевые эксперименты на турнирах по Rocket League

Исследователи NVIDIA решают проблему сложного планирования конкурентной групповой игры и воссоздания лабораторных условий, внедряя методологию полевых экспериментов. Этот подход интегрирует эксперименты непосредственно в структуру турниров, создавая гибридные турниры-эксперименты.

lab NVIDIA Research · 16 д назад

Фреймворк AITE автономно обнаруживает алгоритмы беспроводной связи с помощью поиска на основе LLM

Исследователи представляют The AI Telco Engineer (AITE), фреймворк, который использует эволюционный поиск, управляемый большими языковыми моделями, для автономного проектирования алгоритмов решения сложных задач связи при учете компромиссов между производительностью и вычислительной сложностью.

media TLDR AI · 13 д назад · 4 просмотра

Anthropic выпустила Claude Opus 5; NVIDIA призывает к политике открытых весов

Anthropic представила Claude Opus 5 как более эффективную модель, которая по возможностям приближается к Claude Fable 5 при вдвое меньшей стоимости, став моделью по умолчанию для Claude Max. Параллельно NVIDIA выступает за политику правительства США в поддержку моделей ИИ с открытыми весами, чтобы стимулировать инновации и укреплять лидерство Америки в этой сфере.

lab Hugging Face Blog · 20 д назад · 1 просмотр

NVIDIA выпустила Cosmos 3 Edge — модель с 4 миллиардами параметров для управления роботами в реальном времени на периферийных устройствах

NVIDIA выпустила Cosmos 3 Edge, открытую модель реального мира с 4 миллиардами параметров, предназначенную для обеспечения производительности уровня дата-центра на периферийных системах с ограниченной памятью. Модель позволяет роботам и агентам компьютерного зрения понимать окружающую среду, рассуждать в реальном времени и генерировать действия непосредственно на устройствах, таких как модули NVIDIA Jetson.

lab Hugging Face Blog · 24 д назад · 8 просмотров

NVIDIA выпускает модели встраивания Nemotron 3 Embed, занимающие #1 место в RTEB

NVIDIA выпустила Nemotron 3 Embed, набор открытых и коммерчески доступных моделей встраивания, предназначенных для улучшения качества поиска по базе знаний (RAG) производственного масштаба, агентного поиска, поиска по коду и памяти агентов. В коллекцию входит модель объемом 8B, занимающая #1 место в общем зачете на доске лидеров RTEB, а также эффективные варианты объемом 1B, оптимизированные для развертывания.

media MarkTechPost · 1 д назад

NVIDIA выпустила NOOA, объектно-ориентированную Python-фреймворк для создания ИИ-агентов

Лаборатории NVIDIA открыли исходный код NOOA (NVIDIA Object-Oriented Agents), фреймворка на Python, не зависящего от моделей, который объединяет разработку агентов в один класс Python. Этот подход заменяет фрагментированные рабочие процессы, включающие шаблоны запросов и графы рабочих процессов, сопоставляя методы действиям, поля — состоянию, docstrings — запросам, а аннотации типов — обязательным контрактам.

media MarkTechPost · 4 д назад · 1 просмотр

NVIDIA выпустила Alpamayo 2 Super, 34B открытую VLA-модель для автономного вождения

NVIDIA выпустила Alpamayo 2 Super, 34-миллиардную модель vision-language-action (VLA), предназначенную для роботакси и автономного вождения под лицензией OpenMDW-1.1. Модель ориентирована на обработку редких событий за счёт объединения бэкбона Cosmos 3 Super Reasoner на 32B с диффузионным декодером действий на 2.3B, который генерирует траектории, каузальные объяснения и мета-действия из видео с нескольких камер.

media MarkTechPost · 7 д назад · 4 просмотра

NVIDIA NeMo выпускает Molt, компактную PyT-native агентную RL-фреймворк

Команда NVIDIA NeMo выпустила Molt, фреймворк для агентного обучения с подкреплением с открытым исходным кодом, предназначенный для снижения сложности итераций алгоритмов для исследователей. Базовый код содержит около 8.6K строк RL-кода, что значительно меньше по сравнению со схожими фреймворками, такими как verl (62K строк) и slime (25K строк).

media r/LocalLLaMA · 10 д назад · 1 просмотр

Lucebox и AMD обогнали Nvidia DGX Spark в 3,63 раза на DeepSeek V4 Flash

Lucebox объединила усилия с AMD для демонстрации гетерогенной конфигурации потребительского оборудования, которая превосходит Nvidia DGX Spark по скорости вывода. Система сочетает GPU AMD Radeon AI PRO R9700 и процессор Strix Halo для запуска полной модели DeepSeek V4 Flash на 284B.

media Together AI Blog · 10 д назад · 2 просмотра

ThunderAgent обеспечивает ускорение агентного вывода в 2 раза за счёт планирования на уровне программы

ThunderAgent — это система, которая вводит абстракцию программы для планирования запросов агентов LLM с целью устранения фрагментации KV-кэша при генерации синтетических данных с высокой степенью параллелизма. Рассматривая рабочие процессы агентов как планируемые программы, а не независимые запросы, она значительно повышает пропускную способность и снижает задержку.

media r/LocalLLaMA · 13 д назад · 1 просмотр

Дженсен Хуанг ссылается на модель с открытым весом в инциденте Hugging Face для запуска Альянса по обеспечению безопасности ИИ

Генеральный директор NVIDIA Дженсен Хуанг заявил, что модель с открытым весом помогла сдержать вторжение в систему безопасности во время недавнего инцидента на платформе Hugging Face, тогда как закрытые системы ИИ блокировали необходимый анализ следов. Он назвал это событие главной причиной создания Альянса по обеспечению безопасности ИИ.

lab Hugging Face Blog · 13 д назад · 19 просмотров

NVIDIA представляет Cosmos-H-Dreams — симулятор хирургической робототехники в реальном времени

NVIDIA представила Cosmos-H-Dreams, генеративный симулятор для хирургической робототехники, работающий в реальном времени и управляемый действиями, который переносит возможности своего Cosmos-H-Surgical-Simulator в причинную модель-студент. Система обслуживается через библиотеку ускоренного потокового вывода FlashDreams от NVIDIA и обеспечивает интерактивное управление человеком или обученной политикой по замкнутому контуру.

lab NVIDIA Technical Blog · 13 д назад · 5 просмотров

NVIDIA Nemotron 3 Ultra лидирует среди открытых моделей по точности и эффективности в агентном RTL-кодировании

Компания NVIDIA выпустила модель Nemotron 3 Ultra, которая лидирует среди открытых моделей как по точности, так и по эффективности в задачах агентного проектирования на языке переноса регистров (RTL).

arxiv arXiv cs.AI · 17 д назад · 4 просмотра

SLAI T-Rex позволяет проводить полное параметрическое постобучение модели DeepSeek-V4 на платформе Ascend SuperPOD

SLAI представляет T-Rex — сквозную оптимизационную платформу для полного параметрического постобучения моделей MoE триллионного масштаба на суперкластере NPU Ascend. Используя семейство моделей DeepSeek-V4 в качестве целевой нагрузки, система решает проблемы с памятью и накладными расходами на коммуникацию за счёт иерархического параллелизма и оптимизации выполнения ядер.

arxiv arXiv cs.CL · 17 д назад · 1 просмотр

SLAI T-Rex позволяет проводить полное параметрическое постобучение DeepSeek-V4 на Ascend SuperPOD

SLAI представляет T-Rex, сквозную оптимизационную рамку для полного параметрического постобучения MoE-моделей триллионного масштаба на Ascend NPU SuperPOD. Используя семейство моделей DeepSeek-V4 в качестве целевой рабочей нагрузки, система решает проблемы с давлением памяти и накладными расходами на коммуникацию за счёт иерархического параллелизма и оптимизаций выполнения ядер.