Fuente · NVIDIA Research
lab NVIDIA Research · hace 6 d · 23 vistas

HorizonRelight utiliza autocondicionamiento enmascarado para un relighting consistente de video a largo plazo

Los investigadores abordan las discontinuidades temporales en el relighting de video a largo plazo reformulando la tarea como una traducción de dominio latente condicionada temporalmente. El marco impone continuidad entre fragmentos propagando los latentes del dominio objetivo a través de los límites y utiliza autocondicionamiento enmascarado del dominio objetivo para hacer que este comportamiento sea aprendible.

lab NVIDIA Research · hace 6 d · 28 vistas

Nvidia presenta FusionRelight para el realce de iluminación en retratos en tiempo real mediante la fusión híbrida de conocimiento del dominio

Investigadores de Nvidia han presentado FusionRelight, un método para el realce de iluminación en retratos que combina la transferencia de iluminación físicamente plausible con la preservación de la identidad y una inferencia compacta en tiempo real. El enfoque utiliza la Fusión Híbrida de Conocimiento del Dominio (HDKF), un marco de entrenamiento que destila priores de física, reflectancia y realismo a partir de datos sintéticos, One-Light-at-a-Time (OLAT) y del mundo real en un modelo estudiante.

lab NVIDIA Research · hace 9 d · 61 vistas

Los LLM igualan o superan la optimización bayesiana para la optimización de hiperparámetros

Un nuevo artículo explora el uso de modelos de lenguaje grandes fundamentales (LLM) para automatizar la optimización de hiperparámetros (HPO), un proceso que normalmente depende de enfoques manuales en configuraciones con presupuesto limitado. Los autores desarrollaron una metodología donde los LLM sugieren configuraciones de hiperparámetros basadas en descripciones del conjunto de datos y del modelo, las cuales se refinan iterativamente según el rendimiento del modelo.

lab NVIDIA Research · hace 9 d · 56 vistas

Source introduce diferenciación desenrollada aproximada para la atribución de datos de entrenamiento

Los investigadores presentan Source, un nuevo método de atribución de datos de entrenamiento (TDA) que combina la eficiencia computacional de las funciones de influencia con la precisión de los enfoques basados en desenrollado. Al utilizar una fórmula similar a la función de influencia para aproximar la diferenciación desenrollada, Source aborda limitaciones en los métodos de diferenciación implícita, como su incapacidad para tener en cuenta el sesgo de optimización o los pipelines de múltiples etapas.

lab NVIDIA Research · hace 9 d · 34 vistas

NVIDIA lanza OmniDreams, un modelo generativo de mundo en tiempo real para la simulación de vehículos autónomos

NVIDIA ha presentado OmniDreams, un modelo generativo de mundo base diseñado para abordar los cuellos de botella en la evaluación de políticas de conducción autónoma dentro de simulaciones de bucle cerrado. Entrenado y post-entrenado a partir del modelo de difusión Cosmos con 21k horas de escenarios de conducción, genera videos condicionados por acciones de forma autoregresiva en tiempo real.

lab NVIDIA Research · hace 9 d · 31 vistas

jlorraine presenta herramientas de optimización anidada escalables para el aprendizaje profundo

El artículo introduce una tesis de jlorraine que aborda los desafíos de aplicar la optimización de dos niveles o anidada a configuraciones de aprendizaje profundo a gran escala. Mientras que la optimización basada en gradientes típicamente actualiza un solo conjunto de parámetros, muchas aplicaciones requieren actualizar subconjuntos de parámetros en diferentes objetivos anidados unos dentro de otros.

lab NVIDIA Research · hace 10 d · 30 vistas

Masters destila modelos de visión y lenguaje mediante enmascaramiento del maestro y refuerzo del estudiante

Los investigadores proponen Masters, un marco de aprendizaje por refuerzo progresivo con enmascaramiento para destilar modelos grandes de visión y lenguaje en versiones compactas adecuadas para implementación en dispositivos periféricos. El método aborda la inestabilidad causada por la brecha de tamaño entre los modelos maestro y estudiante.

lab NVIDIA Research · hace 10 d · 36 vistas

DSTP mitiga fallos en la poda de tokens visuales en el razonamiento complejo de MLLM

Los investigadores identificaron el Desplazamiento de Información Visual Relevante (RVIS) durante la decodificación como la causa principal del fallo de los métodos existentes de poda de tokens visuales en Modelos de Lenguaje Grande Multimodales (MLLM). Para abordar esto, proponen la Poda de Tokens Consciente del Desplazamiento en la Etapa de Decodificación (DSTP), un marco sin entrenamiento que alinea los tokens visuales con los requisitos cambiantes del razonamiento.

lab NVIDIA Research · hace 10 d · 26 vistas

GenRecal destila grandes modelos de visión y lenguaje en pequeños mediante recalibración

Los investigadores presentan GenRecal, un marco de destilación de propósito general que transfiere conocimiento de grandes modelos de visión y lenguaje (VLM) a contrapartes más pequeñas y eficientes. El método aborda el desafío de las arquitecturas VLM heterogéneas mediante un Recalibrador para alinear y adaptar las representaciones de características entre diferentes tipos de modelos.

lab NVIDIA Research · hace 10 d · 28 vistas

ZPPO utiliza prompts en lugar de gradientes para mejorar el entrenamiento de modelos visiolingüísticos pequeños

Los investigadores presentan la Optimización de Política en la Zona Próxima (ZPPO), un método que inyecta conocimiento del maestro en los prompts en lugar de en los gradientes de la política para abordar la fragilidad en la destilación de conocimiento y la deriva en el aprendizaje por refuerzo. ZPPO construye Preguntas con Candidato Binario Incluido (BCQ) y Preguntas con Candidato Negativo Incluido (NCQ) para preguntas difíciles, recirculándolas a través de un búfer de repetición hasta que la precisión del estudiante mejore o sean expulsadas.

lab NVIDIA Research · hace 10 d · 21 vistas

Hide to See introduce enmascaramiento de prefijo de razonamiento para destilación VLM

Los investigadores proponen un nuevo marco de destilación pensar-responder que mejora la capacidad de los modelos visuo-lingüísticos compactos para utilizar evidencia visual mediante el enmascaramiento de prefijos de razonamiento salientes. Este enfoque aborda el problema del "olvido visual" común en rastros largos de pensar-responder, donde los estudiantes pierden el foco en las pistas visuales durante el razonamiento extendido.

lab NVIDIA Research · hace 10 d · 15 vistas

SpatialClaw utiliza código como interfaz de acción para el razonamiento espacial agéntico

Los investigadores proponen SpatialClaw, un marco sin entrenamiento que adopta el código como la interfaz de acción para mejorar el razonamiento espacial abierto 3D y 4D en modelos de visión-lenguaje. A diferencia de los agentes existentes que dependen de ejecuciones de un solo paso o llamadas de herramientas rígidas, SpatialClaw mantiene un kernel de Python con estado precargado con marcos de entrada y primitivas de percepción.

lab NVIDIA Research · hace 10 d · 27 vistas

AXPO mejora el razonamiento agénico multimodal corrigiendo la brecha entre pensar y actuar

Los investigadores proponen la Optimización Exploratoria de Políticas de Agentes (AXPO) para abordar la "brecha entre pensar y actuar" en modelos de visión y lenguaje que requieren herramientas externas. Esta brecha hace que los métodos estándar de RL como GRPO intenten usar herramientas solo en ~30% de las trayectorias, con altas tasas de fallo que suprimen las señales de aprendizaje.

lab NVIDIA Research · hace 15 d · 36 vistas

ROSA mejora la productividad de las fábricas hasta 12,06 veces mediante el servicio compartido de GPU-pool

Los investigadores proponen ROSA, un sistema de servicio de modelos base de robótica diseñado para fábricas de robots que va más allá de los supuestos de computación en el borde y de un solo robot. El sistema utiliza el servicio compartido de GPU-pool para permitir que flotas de robots accedan a GPUs de clase servidor a través de la red.

lab NVIDIA Research · hace 24 d · 28 vistas

NVIDIA presenta Spatial-IQ, un marco de diagnóstico jerárquico para el razonamiento espacial en modelos multimodales

Investigadores de NVIDIA han presentado Spatial-IQ, un marco de diagnóstico diseñado para descomponer la inteligencia espacial de los grandes modelos de lenguaje multimodales (MLLMs). A diferencia de las evaluaciones existentes que tratan a los modelos como cajas negras, este enfoque descompone el conteo de objetos en estructuras 3D apiladas en nueve sub-tareas perceptivas y cognitivas alineadas con las etapas del desarrollo humano.

lab NVIDIA Research · hace 24 d · 38 vistas

Cuantización de código agrupado para compresión de imágenes basada en Gaussiana 2D

Los investigadores presentan Cluster-Guided Vector Quantization (CGVQ), un método diseñado para mejorar el rendimiento de tasa-distorsión en la compresión de imágenes basada en primitivas gaussianas. El enfoque particiona los parámetros de Gaussiana en grupos homogéneos antes de la cuantización, abordando la ineficiencia causada por almacenar grandes cantidades de parámetros de punto flotante por primitiva.