REVES introduce un marco iterativo de dos etapas que mejora el razonamiento de los modelos de lenguaje grandes mediante revisión y verificación secuenciales. Logra +6.5 puntos sobre las líneas base de RL y +4.0 puntos sobre el entrenamiento estándar de múltiples turnos en LiveCodeBench, utilizando un modelo base de 4B con menos rollouts que sistemas más grandes. El método mejora la corrección de errores y se generaliza a rompecabezas fuera de distribución como n_queens y mini_sudoku.
REVES: Entrenamiento aumentado para escalado en tiempo de prueba
REVES: Entrenamiento aumentado para escalado en tiempo de prueba
REVES introduce un marco iterativo de dos etapas que mejora el razonamiento de los LLM mediante revisión y verificación secuenciales. Logra +6.5 puntos sobre las líneas base de RL y +4.0 puntos sobre el entrenamiento estándar multi-turno en LiveCodeBench, utilizando un modelo base de 4B con menos rollouts que los sistemas evolutivos grandes. El método mejora la corrección de errores y se generaliza a acertijos fuera de distribución como n_queens y mini_sudoku.
VIMPO: Optimización de política sin crítico para LLMs
VIMPO introduce un método de optimización de política sin crítico que deriva una función de valor implícita por la política a partir del aprendizaje por refuerzo con regularización KL. Permite la incorporación de recompensas verificables sin entrenar un crítico y supera a GRPO en benchmarks matemáticos, especialmente bajo recompensas ruidosas.
Control jerárquico basado en LLM en juegos multiagente
Un sistema jerárquico que utiliza un LLM preentrenado para seleccionar políticas de habilidades de RL supera al RL plano en un entorno King of the Hill 2v2. Igualua el rendimiento de los árboles de comportamiento diseñados a mano en tasa de victoria y es percibido como más humano por el 60% de los usuarios, destacando una coordinación efectiva y adaptabilidad sin diseño manual de reglas.
DPO Secuencial Muestra Impacto Variable de Preferencia en Distintos Entornos
Un estudio de la Optimización Directa de Preferencia secuencial encuentra que el entrenamiento posterior no degrada uniformemente las preferencias aprendidas anteriormente. El efecto varía según la relación del objetivo, la intensidad de la señal y el orden de entrenamiento, oscilando entre degradación parcial y transferencia positiva. El análisis a nivel de pares revela cambios heterogéneos, con pares de preferencia de alta confianza que a veces mejoran a pesar de la estabilidad de las métricas agregadas.
Aprendizaje de currículo bayesiano en variedades latentes de LLM
Manifold Bandits introduce el Currículo de Variedad Bayesiana (BMC), un marco que modela el muestreo de problemas como un problema estructurado de bandits en el espacio latente de los LLM. BMC organiza las tareas en un árbol jerárquico y utiliza aprendizaje bayesiano para guiar el muestreo, revelando compensaciones entre la señal de aprendizaje, la diversidad de tareas y la relevancia de la evaluación. Priorizar únicamente la dificultad no logra un buen rendimiento en tareas posteriores, subrayando la necesidad de estructura y muestreo consciente del tipo.