El podcast analiza la evolución de las recetas de post-entrenamiento en modelos de lenguaje grandes, desde InstructGPT hasta los modelos frontier de 2026. Destaca la Distilación On-Policy Multi-Maestro (MOPD) como el patrón dominante, donde los modelos especialistas por dominio se entrenan y luego se destilan en un modelo estudiante general mediante distilación on-policy, escalando a más de 10 maestros en modelos como DeepSeek V4 y Nemotron 3 Ultra.
Revisión de la receta de post-entrenamiento de Frontier con Finbarr Timbers
RACL: Capa de Control de Agente de Razonamiento para Aprendizaje Metaheurístico
RACL introduce un agente de razonamiento que controla el comportamiento de búsqueda metaheurística sin reemplazar optimizadores ni alterar restricciones. Mejora o iguala políticas clave en experimentos de enrutamiento de vehículos, reduciendo el costo promedio en un 8.337% frente a las políticas Fijas y en un 1.605% frente a las políticas Activadas por Estancamiento, sin sobrecarga computacional significativa.
Entrenamiento de LLMs para agentes de ciclo de vida largo mediante generalización entre dominios
Un nuevo marco permite a los modelos de lenguaje grandes desarrollar la capacidad de 'Conectar los Puntos', permitiendo que los agentes de ciclo de vida largo aprendan de experiencias y actualicen iterativamente el contexto de su entorno. El marco utiliza aprendizaje por refuerzo con secuencias de rollout largas y tareas personalizadas para promover la generalización entre dominios, mostrando un rendimiento efectivo fuera de la distribución tanto en configuraciones de dominio como de transición.
Entrenamiento de LLMs para agentes de ciclo de vida largo mediante generalización interdominio
Un nuevo marco permite a los modelos de lenguaje grandes aprender 'Conecta los puntos' utilizando aprendizaje por refuerzo con secuencias de rollout largas. El método incluye tareas y entornos adaptados para fomentar el desarrollo de meta-capacidades, mostrando una fuerte generalización interdominio y rendimiento en configuraciones fuera de distribución. Las implementaciones están disponibles en https://github.com/agentscope-ai/Trinity-RFT/tree/research/cod/examples/research_cod.
X+Slides: Benchmark para la Generación de Diapositivas Condicionada por Audiencia
X+Slides introduce un benchmark que evalúa la generación de diapositivas en función de las necesidades del público objetivo. Utiliza 8,133 sondas fundamentadas en la fuente a través de 113 temas y siete escenas para medir la Cobertura de Audiencia, Cobertura por Dominio, Eficiencia y Corrección, revelando que los sistemas actuales recuperan solo información parcial esencial para la audiencia, con DeepPresenter logrando 0.714 de Cobertura de Audiencia, SlideTailor 0.594 y NotebookLM ablation 0.853, destacando la necesidad de una evaluación fundamentada en la fuente.
Los modelos base de aprendizaje por refuerzo ya deberían existir
El aprendizaje por refuerzo carece de modelos base a pesar de que los MDPs sintéticos son viables. Una prueba de concepto muestra que un único modelo entrenado en MDPs sintéticos resuelve benchmarks tabulares sin ajuste, superando a los métodos existentes en entornos online y igualándolos en entornos offline.