MGUP introduce un mecanismo de actualización selectiva que aplica tamaños de paso más grandes a una proporción fija de parámetros en la optimización estocástica, mientras usa tamaños de paso más pequeños y no nulos para el resto. Se integra sin problemas con optimizadores como AdamW, Lion y Muon, proporcionando garantías teóricas de convergencia para MGUP-AdamW y demostrando un rendimiento superior o más estable en el entrenamiento de modelos de lenguaje grandes y tareas de preentrenamiento MAE.
MGUP: Alineación de Gradiente-Momento para Optimización Selectiva
FoMoE rompe la barrera de réplicas completas con capas de expertos particionadas
FoMoE introduce un sistema que particiona las capas de expertos entre trabajadores para evitar réplicas completas del modelo, reduciendo los costos de comunicación hasta 1.42x en comparación con las líneas base y 45.44x en comparación con DDP. Logra aceleraciones de rendimiento de hasta 1.4x mediante un mecanismo de salto de token y demuestra un enrutamiento estable, con beneficios proyectados que se extienden a modelos de escala 100B a través del modelado del sistema.
Solución al descenso abrupto de decodificación de contexto largo en Radeon R9700 con vLLM 0.22.1
Un descenso abrupto en el rendimiento de decodificación de contexto largo en AMD Radeon AI PRO R9700 (RDNA4) fue resuelto habilitando AITER Unified Attention en vLLM 0.22.1. La corrección implica relajar un gate CDNA para incluir RDNA4, deshabilitar otros backends de atención y usar caché KV bf16, lo que resulta en aceleraciones significativas en todas las longitudes de contexto. FP8 KV es ineficaz en este hardware, y el contexto nativo del modelo de 262K se logra completamente con bf16, ofreciendo ~2.9× concurrencia sin necesidad de FP8.
UltraQuant: Caché KV de 4 bits para agentes con alta carga de contexto
UltraQuant permite el caché KV de 4 bits para agentes con alta carga de contexto, reduciendo el tiempo P50 hasta el primer token en 3.47x en rondas tardías y aumentando el rendimiento de salida en 1.63x sobre la línea base FP8 KV. Logra esto mediante consultas FP8, tensores KV FP4, escalas de grupo UE8M0 y MFMA escalado nativo en GPUs AMD CDNA4, con optimizaciones para kernels de decode-attention y elecciones de diseño robustas como el tratamiento asimétrico K/V y la rotación de Walsh-Hadamard.
UltraQuant: Caché KV de 4 bits para agentes con alta carga de contexto
UltraQuant introduce un método de caché KV de 4 bits diseñado para cargas de trabajo de agentes con alta demanda de contexto. Logra una reducción de 3.47x en el tiempo P50 hasta el primer token en rondas tardías y un aumento de 1.63x en el rendimiento de salida en comparación con el caché KV FP8, utilizando consultas FP8, tensores KV FP4 y soporte nativo AMD CDNA4 para scaled-MFMA.
Cápsulas de estado de ejecución para inferencia de IA en dispositivo con baja latencia
Las cápsulas de estado de ejecución permiten la verificación y restauración de puntos de control vinculados al gráfico del estado completo de ejecución, incluidos los estados KV, recurrentes y de convolución, para la inferencia de IA en dispositivo con baja latencia y lotes pequeños. En RTX 5090 y Jetson AGX Thor, la restauración de cápsulas logra una corrección exacta a nivel de bytes e idéntica a nivel de tokens, con operaciones de GPU de submilisegundo y aceleraciones de TTFT hasta 27x en 16k tokens, demostrando una reducción significativa de latencia en flujos de trabajo de IA interactivos.