AoiZora es un planificador de topología mediado por compilador que mejora la inferencia de difusión de video de baja latencia en sub-slices de TPU. Al alinear el fragmentado lógico con la colocación física a través del flujo de compilación, reduce la latencia de desruido de un paso hasta 1.42x en sub-slices de TPU v5e en comparación con los métodos existentes.
AoiZora: Optimización auto-paralela consciente de la topología para inferencia de difusión de video
Nvidia presenta FusionRelight para el realce de iluminación en retratos en tiempo real mediante la fusión híbrida de conocimiento del dominio
Investigadores de Nvidia han presentado FusionRelight, un método para el realce de iluminación en retratos que combina la transferencia de iluminación físicamente plausible con la preservación de la identidad y una inferencia compacta en tiempo real. El enfoque utiliza la Fusión Híbrida de Conocimiento del Dominio (HDKF), un marco de entrenamiento que destila priores de física, reflectancia y realismo a partir de datos sintéticos, One-Light-at-a-Time (OLAT) y del mundo real en un modelo estudiante.
Lucebox y AMD superan a Nvidia DGX Spark por 3.63x en DeepSeek V4 Flash
Lucebox se ha asociado con AMD para demostrar una configuración de hardware heterogénea para consumidores que supera a Nvidia DGX Spark en velocidad de inferencia. El sistema combina una GPU AMD Radeon AI PRO R9700 con un procesador Strix Halo para ejecutar el modelo completo DeepSeek V4 Flash de 284B.
Cuantización de código agrupado para compresión de imágenes basada en Gaussiana 2D
Los investigadores presentan Cluster-Guided Vector Quantization (CGVQ), un método diseñado para mejorar el rendimiento de tasa-distorsión en la compresión de imágenes basada en primitivas gaussianas. El enfoque particiona los parámetros de Gaussiana en grupos homogéneos antes de la cuantización, abordando la ineficiencia causada por almacenar grandes cantidades de parámetros de punto flotante por primitiva.
Tutorial de NVIDIA demuestra programación de GPU basada en tiles con cuTile y Triton
Un nuevo tutorial explora el framework TileGym de NVIDIA mediante la creación de un flujo de trabajo práctico en Colab que se adapta a diferentes condiciones de hardware. La guía analiza el entorno CUDA para determinar si NVIDIA cuTile puede ejecutarse directamente, recurriendo a Triton cuando las GPU estándar de Col carecen del stack requerido.
RTX 6000 PRO MaxQ con mod de shunt supera a RTX 5090 en benchmarks de Anima y LLM
Un usuario compara el rendimiento completo de cómputo de una RTX 5090 frente a tarjetas RTX 6000 PRO MaxQ modificadas con shunt y refrigeradas por agua, así como una edición WS de la RTX 6000 PRO alquilada. La prueba evalúa tanto las puntuaciones del benchmark Anima como las velocidades de procesamiento de prompts LLM en varios límites de potencia.