RACL introduce un agente de razonamiento que controla el comportamiento de búsqueda metaheurística sin reemplazar optimizadores ni alterar restricciones. Mejora o iguala políticas clave en experimentos de enrutamiento de vehículos, reduciendo el costo promedio en un 8.337% frente a las políticas Fijas y en un 1.605% frente a las políticas Activadas por Estancamiento, sin sobrecarga computacional significativa.
RACL: Capa de Control de Agente de Razonamiento para Aprendizaje Metaheurístico
H-RePlan: Recuperación jerárquica para sistemas de agentes multi-dispositivo
H-RePlan introduce un marco de replanificación jerárquica que separa la recuperación de estrategias locales del dispositivo de la replanificación global del orquestador. Supera a las líneas base existentes al lograr una mayor tasa de finalización y adherencia a las instrucciones, con menor costo en tokens, mediante una recuperación consciente del alcance en sistemas de agentes multi-dispositivo.
Entrenamiento de LLMs para agentes de ciclo de vida largo mediante generalización entre dominios
Un nuevo marco permite a los modelos de lenguaje grandes desarrollar la capacidad de 'Conectar los Puntos', permitiendo que los agentes de ciclo de vida largo aprendan de experiencias y actualicen iterativamente el contexto de su entorno. El marco utiliza aprendizaje por refuerzo con secuencias de rollout largas y tareas personalizadas para promover la generalización entre dominios, mostrando un rendimiento efectivo fuera de la distribución tanto en configuraciones de dominio como de transición.
Entrenamiento de LLMs para agentes de ciclo de vida largo mediante generalización interdominio
Un nuevo marco permite a los modelos de lenguaje grandes aprender 'Conecta los puntos' utilizando aprendizaje por refuerzo con secuencias de rollout largas. El método incluye tareas y entornos adaptados para fomentar el desarrollo de meta-capacidades, mostrando una fuerte generalización interdominio y rendimiento en configuraciones fuera de distribución. Las implementaciones están disponibles en https://github.com/agentscope-ai/Trinity-RFT/tree/research/cod/examples/research_cod.
Act2Answer evalúa la retención de conocimiento en modelos de visión-lenguaje-acción
Act2Answer introduce un protocolo ligero para evaluar la retención de conocimiento del sentido común y del mundo en modelos VLA, requiriendo que los agentes respondan preguntas mediante acciones de colocación de objetos. Un estudio a gran escala de 7 modelos VLA y 9 líneas base VLM revela que los VLA funcionan bien en conceptos simples pero muestran brechas mayores en categorías semánticas ricas en comparación con sus VLMs fuente, con el co-entrenamiento VQA mejorando la retención de conocimiento y señales pico relevantes para la respuesta observadas en las capas intermedias de VLA.
Marco de Auto-Distilación Condicionada por Rúbrica
La Auto-Distilación Condicionada por Rúbrica introduce un marco que utiliza rúbricas estructuradas para proporcionar retroalimentación a nivel de token y de alta granularidad durante la auto-distilación de modelos de lenguaje de razonamiento. Al condicionar los modelos maestro en criterios a nivel de rúbrica, permite una asignación de crédito más precisa que las recompensas escalares, superando a GRPO y OPSD por 1.0 y 0.9 puntos en promedio en benchmarks de razonamiento científico.