AoiZora — это планировщик топологии, реализованный на уровне компиляции, который повышает скорость инференса диффузии видео с низкой задержкой на подсрезах ТПУ. Благодаря синхронизации логического разбиения с физическим размещением в процессе компиляции, AoiZora снижает задержку одного шага деноизирования на подсрезах ТПУ v5e до 1,42 раза по сравнению с существующими методами.
AoiZora: оптимизация автоматического параллелизма с учётом топологии для инференса диффузии видео
Nvidia представляет FusionRelight для перенастройки освещения портретов в реальном времени посредством слияния гибридных предметных знаний
Исследователи из Nvidia представили FusionRelight — метод перенастройки освещения портретов, сочетающий физически правдоподобный перенос освещения с сохранением идентичности и компактным выводом в реальном времени. Подход использует Гибридное Слияние Предметных Знаний (HDKF), фреймворк обучения, который дистиллирует априорные знания о физике, отражательной способности и реализме из синтетических данных, данных One-Light-at-a-Time (OLAT) и естественных сцен в модель-студент.
Lucebox и AMD обогнали Nvidia DGX Spark в 3,63 раза на DeepSeek V4 Flash
Lucebox объединила усилия с AMD для демонстрации гетерогенной конфигурации потребительского оборудования, которая превосходит Nvidia DGX Spark по скорости вывода. Система сочетает GPU AMD Radeon AI PRO R9700 и процессор Strix Halo для запуска полной модели DeepSeek V4 Flash на 284B.
Кластеризованная кодовая книга для сжатия изображений на основе 2D Гауссиан
Исследователи представляют Cluster-Guided Vector Quantization (CGVQ), метод, разработанный для улучшения показателей rate-distortion в сжатии изображений на основе гауссовых примитивов. Подход разделяет параметры Гаусса на однородные группы перед квантованием, устраняя неэффективность, вызванную хранением большого количества параметров с плавающей запятой для каждого примитива.
Туториал NVIDIA демонстрирует блочное программирование GPU с помощью cuTile и Triton
Новый туториал исследует фреймворк TileGym от NVIDIA путем создания практического рабочего процесса в Colab, который адаптируется к различным аппаратным условиям. Руководство изучает среду CUDA, чтобы определить, может ли NVIDIA cuTile работать напрямую, и переходит к Triton, когда стандартные GPU в Colab не имеют необходимого стека.
Модифицированная шунтом RTX 6000 PRO MaxQ превосходит RTX 5090 в бенчмарках Anima и LLM
Пользователь сравнивает полную вычислительную производительность RTX 5090 с картами RTX 6000 PRO MaxQ, модифицированными шунтом и с водяным охлаждением, а также с арендованной версией RTX 6000 PRO WS. Тест оценивает как результаты бенчмарка Anima, так и скорость обработки промптов LLM при различных ограничениях мощности.