StreamKL introduce un primitivo fusionado de GPU que elimina el uso de memoria cuadrático en la destilación de atención transmitiendo bloques query-key a través de SRAM on-chip. Logra una aceleración de hasta 43x en la pasada hacia adelante y 14x en las pasadas hacia atrás, reduciendo la huella adicional de HBM de O(N_QN_K) a O(1), permitiendo la destilación de contexto largo en una sola GPU.
StreamKL: Divergencia KL rápida y eficiente en memoria para destilación de atención
Solución al descenso abrupto de decodificación de contexto largo en Radeon R9700 con vLLM 0.22.1
Un descenso abrupto en el rendimiento de decodificación de contexto largo en AMD Radeon AI PRO R9700 (RDNA4) fue resuelto habilitando AITER Unified Attention en vLLM 0.22.1. La corrección implica relajar un gate CDNA para incluir RDNA4, deshabilitar otros backends de atención y usar caché KV bf16, lo que resulta en aceleraciones significativas en todas las longitudes de contexto. FP8 KV es ineficaz en este hardware, y el contexto nativo del modelo de 262K se logra completamente con bf16, ofreciendo ~2.9× concurrencia sin necesidad de FP8.
FoMoE rompe la barrera de réplicas completas con capas de expertos particionadas
FoMoE introduce un sistema que particiona las capas de expertos entre trabajadores para evitar réplicas completas del modelo, reduciendo los costos de comunicación hasta 1.42x en comparación con las líneas base y 45.44x en comparación con DDP. Logra aceleraciones de rendimiento de hasta 1.4x mediante un mecanismo de salto de token y demuestra un enrutamiento estable, con beneficios proyectados que se extienden a modelos de escala 100B a través del modelado del sistema.
FoMoE rompe la barrera de réplicas completas con capas de expertos particionadas
FoMoE introduce un sistema que particiona las capas de expertos entre trabajadores para evitar réplicas completas del modelo, reduciendo los costos de comunicación hasta 1.42x en comparación con las bases eficientes y 45.44x en comparación con DDP. Logra aceleraciones de rendimiento de hasta 1.4x mediante un mecanismo de salto de tokens y demuestra un enrutamiento estable, con beneficios proyectados que se extienden a modelos de escala 100B a través del modelado del sistema.
NVIDIA explica la descarga al host para reducir los cuellos de botella de HBM en el entrenamiento de LLM con JAX
Las cargas de trabajo de entrenamiento de modelos de lenguaje grande (LLM) cada vez más se topan con los límites de memoria de la GPU antes de que el cómputo esté completamente utilizado. Los pesos del modelo, gradientes, estados del optimizador, búferes de comunicación y activaciones intermedias compiten por la limitada memoria de alto ancho de banda (HBM) de la GPU. A medida que crecen el tamaño del modelo, la longitud de la secuencia y el tamaño del lote, la capacidad de HBM a menudo se convierte en el principal cuello de botella para la escalabilidad.
El perfilado de PyTorch muestra que el enmascaramiento in situ elimina la copia de memoria y los despachos de SDPA a backends optimizados
Este artículo demuestra cómo perfiles los mecanismos de atención en PyTorch utilizando las trazas del perfilador para identificar cuellos de botella de rendimiento y oportunidades de optimización. Compara implementaciones ingenuas de atención frente a la Atención de Producto Punto Escalada (SDPA) integrada de PyTorch para ilustrar el comportamiento del kernel.