Manifold Bandits introduce el Currículo de Variedad Bayesiana (BMC), un marco que modela el muestreo de problemas como un problema estructurado de bandits en el espacio latente de los LLM. BMC organiza las tareas en un árbol jerárquico y utiliza aprendizaje bayesiano para guiar el muestreo, revelando compensaciones entre la señal de aprendizaje, la diversidad de tareas y la relevancia de la evaluación. Priorizar únicamente la dificultad no logra un buen rendimiento en tareas posteriores, subrayando la necesidad de estructura y muestreo consciente del tipo.
Aprendizaje de currículo bayesiano en variedades latentes de LLM
VIMPO: Optimización de política sin crítico para LLMs
VIMPO introduce un método de optimización de política sin crítico que deriva una función de valor implícita por la política a partir del aprendizaje por refuerzo con regularización KL. Permite la incorporación de recompensas verificables sin entrenar un crítico y supera a GRPO en benchmarks matemáticos, especialmente bajo recompensas ruidosas.
TAPO: Auto-distilación con trayectorias micro-reflectivas
TAPO avanza la auto-distilación mediante la construcción de trayectorias micro-reflectivas explícitas que retienen el razonamiento erróneo e insertan diagnósticos en lenguaje natural. Estas trayectorias, derivadas de rollouts del modelo correctos e incorrectos, proporcionan correcciones de error finas ancladas en el propio razonamiento del modelo, mejorando tanto el razonamiento del primer intento como la corrección de errores en comparación con GRPO.
Asignación de crédito autocondicionada para RL con recompensas verificables
SC-GRPO utiliza la divergencia KL por token desde trayectorias autocondicionadas para ponderar gradientes en el aprendizaje por refuerzo. Supera a GRPO en un 8.1% y a DAPO en un 5.9% en tareas de matemáticas, código y agentes, con un rendimiento superior fuera de la distribución y mejores resultados que OPD.
Memorias latentes ligeras y experienciales para la mejora continua
Un nuevo método permite que los modelos de lenguaje grandes aprendan de sus propias trazas de razonamiento sin supervisión externa. Al destilar el cómputo del tiempo de inferencia en memorias latentes ligeras y modulares, el modelo logra un rendimiento competitivo con el entrenamiento completo y supera las líneas base de cero disparos y ICL crudo en tareas de razonamiento matemático, con una sobrecarga computacional mínima.
SoftMoE: Enrutamiento suave y diferenciable para Mezcla de Expertos en LLMs
SoftMoE reemplaza el enrutamiento discreto top-k con una relajación LapSum suave y diferenciable top-k, permitiendo la optimización basada en gradientes de la selección de expertos. Aprende a asignar la activación del experto de forma no uniforme entre capas, con las capas posteriores activando más expertos, mientras utiliza significativamente menos expertos que el MoE disperso tradicional.