DeepRubric introduce un marco de construcción de datos que genera pares consulta-rúbrica definiendo primero objetivos de evaluación verificables mediante un árbol de evidencia. Genera 9K ejemplos de supervisión y entrena un modelo de 8B con GRPO, logrando un rendimiento comparable al de los modelos más avanzados utilizando 13 veces menos horas de GPU para RL.
DeepRubric: RL eficiente para agentes de investigación profunda
LedgerAgent: Estado estructurado para agentes de llamada de herramientas adherentes a la política
LedgerAgent introduce un libro mayor estructurado para mantener los estados de las tareas por separado en agentes de llamada de herramientas. Convierte los estados en prompts y aplica restricciones de la política antes de la ejecución de herramientas, reduciendo las violaciones de la política y mejorando el rendimiento en dominios de atención al cliente.
Acumulación de Ventaja Marginal para la Autoevolución de Agentes Impulsada por Memoria
Este artículo presenta la Acumulación de Ventaja Marginal (MAA), una arquitectura de postprocesamiento que aborda la inconsistencia entre lotes en la autoevolución de agentes impulsada por memoria. MAA formaliza la alineación y comparabilidad como condiciones estructurales, utiliza señales diferenciales y promedio móvil exponencial para acumular evidencia firmada por operación, y garantiza la trazabilidad mediante la fusión de identidad semántica. Supera a las líneas base a nivel de lote en 14 de cada 16 configuraciones y reduce el consumo de tokens en aproximadamente un 75%.
LedgerAgent: Estado estructurado para agentes de llamada a herramientas adherentes a la política
LedgerAgent introduce un libro contable estructurado para mantener los estados de las tareas separados en agentes que llaman a herramientas. Convierte estos estados en prompts y aplica restricciones de políticas antes de la ejecución de las herramientas, reduciendo las violaciones de políticas y mejorando el rendimiento en dominios de atención al cliente.
Marco de doble agente para traducción verificada entre modelos
Un marco de doble agente convierte protocolos experimentales en lenguaje natural en comandos ejecutables para plataformas robóticas de laboratorio. Utiliza un Agente Analizador y un motor de mapeo basado en reglas para traducir los protocolos, con un Agente de Validación LLM heterogéneo que asegura la precisión e inicia la autocorrección. El marco permite con éxito la ejecución autónoma de extremo a extremo de experimentos basados en placas de microtitulación como el ensayo de Bradford.
Control jerárquico basado en LLM en juegos multiagente
Un sistema jerárquico que utiliza un LLM preentrenado para seleccionar políticas de habilidades de RL supera al RL plano en un entorno King of the Hill 2v2. Igualua el rendimiento de los árboles de comportamiento diseñados a mano en tasa de victoria y es percibido como más humano por el 60% de los usuarios, destacando una coordinación efectiva y adaptabilidad sin diseño manual de reglas.