Un descenso abrupto en el rendimiento de decodificación de contexto largo en AMD Radeon AI PRO R9700 (RDNA4) fue resuelto habilitando AITER Unified Attention en vLLM 0.22.1. La corrección implica relajar un gate CDNA para incluir RDNA4, deshabilitar otros backends de atención y usar caché KV bf16, lo que resulta en aceleraciones significativas en todas las longitudes de contexto. FP8 KV es ineficaz en este hardware, y el contexto nativo del modelo de 262K se logra completamente con bf16, ofreciendo ~2.9× concurrencia sin necesidad de FP8.
Solución al descenso abrupto de decodificación de contexto largo en Radeon R9700 con vLLM 0.22.1
UltraQuant: Caché KV de 4 bits para agentes con alta carga de contexto
UltraQuant permite el caché KV de 4 bits para agentes con alta carga de contexto, reduciendo el tiempo P50 hasta el primer token en 3.47x en rondas tardías y aumentando el rendimiento de salida en 1.63x sobre la línea base FP8 KV. Logra esto mediante consultas FP8, tensores KV FP4, escalas de grupo UE8M0 y MFMA escalado nativo en GPUs AMD CDNA4, con optimizaciones para kernels de decode-attention y elecciones de diseño robustas como el tratamiento asimétrico K/V y la rotación de Walsh-Hadamard.
UltraQuant: Caché KV de 4 bits para agentes con alta carga de contexto
UltraQuant introduce un método de caché KV de 4 bits diseñado para cargas de trabajo de agentes con alta demanda de contexto. Logra una reducción de 3.47x en el tiempo P50 hasta el primer token en rondas tardías y un aumento de 1.63x en el rendimiento de salida en comparación con el caché KV FP8, utilizando consultas FP8, tensores KV FP4 y soporte nativo AMD CDNA4 para scaled-MFMA.
FoMoE rompe la barrera de réplicas completas con capas de expertos particionadas
FoMoE introduce un sistema que particiona las capas de expertos entre trabajadores para evitar réplicas completas del modelo, reduciendo los costos de comunicación hasta 1.42x en comparación con las líneas base y 45.44x en comparación con DDP. Logra aceleraciones de rendimiento de hasta 1.4x mediante un mecanismo de salto de token y demuestra un enrutamiento estable, con beneficios proyectados que se extienden a modelos de escala 100B a través del modelado del sistema.
FoMoE rompe la barrera de réplicas completas con capas de expertos particionadas
FoMoE introduce un sistema que particiona las capas de expertos entre trabajadores para evitar réplicas completas del modelo, reduciendo los costos de comunicación hasta 1.42x en comparación con las bases eficientes y 45.44x en comparación con DDP. Logra aceleraciones de rendimiento de hasta 1.4x mediante un mecanismo de salto de tokens y demuestra un enrutamiento estable, con beneficios proyectados que se extienden a modelos de escala 100B a través del modelado del sistema.
El perfilado de PyTorch muestra que el enmascaramiento in situ elimina la copia de memoria y los despachos de SDPA a backends optimizados
Este artículo demuestra cómo perfiles los mecanismos de atención en PyTorch utilizando las trazas del perfilador para identificar cuellos de botella de rendimiento y oportunidades de optimización. Compara implementaciones ingenuas de atención frente a la Atención de Producto Punto Escalada (SDPA) integrada de PyTorch para ilustrar el comportamiento del kernel.