RegMix-D extiende RegMix aprovechando las trayectorias completas de pérdida de ejecuciones proxy para seleccionar dinámicamente mezclas de datos. Supera a RegMix y DoReMi en 13 tareas downstream, logrando resultados superiores con solo 128 modelos proxy—el 25% del presupuesto computacional de RegMix.
RegMix-D: Mezcla dinámica de datos mediante trayectorias de entrenamiento de proxies
VIMPO: Optimización de política sin crítico para LLMs
VIMPO introduce un método de optimización de política sin crítico que deriva una función de valor implícita por la política a partir del aprendizaje por refuerzo con regularización KL. Permite la incorporación de recompensas verificables sin entrenar un crítico y supera a GRPO en benchmarks matemáticos, especialmente bajo recompensas ruidosas.
Aprendizaje de currículo bayesiano en variedades latentes de LLM
Manifold Bandits introduce el Currículo de Variedad Bayesiana (BMC), un marco que modela el muestreo de problemas como un problema estructurado de bandits en el espacio latente de los LLM. BMC organiza las tareas en un árbol jerárquico y utiliza aprendizaje bayesiano para guiar el muestreo, revelando compensaciones entre la señal de aprendizaje, la diversidad de tareas y la relevancia de la evaluación. Priorizar únicamente la dificultad no logra un buen rendimiento en tareas posteriores, subrayando la necesidad de estructura y muestreo consciente del tipo.
TAPO: Auto-distilación con trayectorias micro-reflectivas
TAPO avanza la auto-distilación mediante la construcción de trayectorias micro-reflectivas explícitas que retienen el razonamiento erróneo e insertan diagnósticos en lenguaje natural. Estas trayectorias, derivadas de rollouts del modelo correctos e incorrectos, proporcionan correcciones de error finas ancladas en el propio razonamiento del modelo, mejorando tanto el razonamiento del primer intento como la corrección de errores en comparación con GRPO.
Asignación de crédito autocondicionada para RL con recompensas verificables
SC-GRPO utiliza la divergencia KL por token desde trayectorias autocondicionadas para ponderar gradientes en el aprendizaje por refuerzo. Supera a GRPO en un 8.1% y a DAPO en un 5.9% en tareas de matemáticas, código y agentes, con un rendimiento superior fuera de la distribución y mejores resultados que OPD.
ConSA: Control de Esparsidad Aprendible en Atención Híbrida
ConSA introduce un marco que aprende la asignación óptima de atención completa frente a ventana deslizante mediante regularización L0 y restricciones de Lagrangiano aumentado. Supera a los métodos basados en reglas, con SWA ubicado en las capas inferiores y FA concentrado en bloques de capas intermedias, un patrón consistente a través de escalas de modelo y niveles de esparsidad.