SkillWeaver introduce un framework de descomponer-recuperar-componer para agentes LLM, formalizando el problema del Enrutamiento de Habilidades Composicionales. Logra una precisión de descomposición del 67.7% mediante Descomposición Iterativa Consciente de Habilidades (SAD), mejorando desde el 51.0% con un valor p menor a 10^-6, y reduce el uso de la ventana de contexto en más del 99%.
SkillWeaver: Enrutamiento de Habilidades Composicionales para Agentes LLM
La minería de trayectorias revela la estructura de habilidades pero no mejora las políticas
Una tubería de tres etapas extrae bibliotecas de habilidades a partir de datos de interacción con GUI, logrando una alta pureza en cinco de los ocho clústeres frente a las etiquetas de InteraSkill. Sin embargo, el método solo mejora ligeramente la precisión de pasos de habilidad en IW y no logra avanzar el rendimiento en BrowseComp+ ni en métricas clave, lo que indica limitaciones en la transferencia de políticas entre dominios.
LegalHalluLens: Auditoría de alucinaciones en IA legal
LegalHalluLens introduce un marco para auditar alucinaciones de IA en contextos legales mediante el análisis de perfiles de alucinación tipificados en cuatro categorías de afirmaciones. Revela una brecha de 38-40 puntos entre las afirmaciones obligatorias/numéricas y temporales, y muestra que dos sistemas con tasas de alucinación idénticas del 52% pueden tener direcciones de riesgo opuestas. El marco utiliza un Índice de Dirección de Riesgo y pipelines de debate calibrados para reducir las detecciones fabricadas en un 45% y mejorar la responsabilidad en el despliegue de IA legal.
DeepRubric: RL eficiente para agentes de investigación profunda
DeepRubric introduce un marco de construcción de datos que genera pares consulta-rúbrica definiendo primero objetivos de evaluación verificables mediante un árbol de evidencia. Genera 9K ejemplos de supervisión y entrena un modelo de 8B con GRPO, logrando un rendimiento comparable al de los modelos más avanzados utilizando 13 veces menos horas de GPU para RL.
Fingerprinting del comportamiento de agentes mediante trayectorias procedimentales
Presentamos un método para identificar agentes por sus huellas dactilares de comportamiento procedimental, logrando una precisión del 85.7% al atribuir trayectorias no vistas a los agentes correctos. Utilizando ProcGrep, analizamos el comportamiento de agentes de codificación en SWE-Bench, descubriendo que los modelos de períodos de lanzamiento similares o destilados entre sí exhiben una similitud de comportamiento más cercana, con una divergencia Jensen-Shannon de 0.25.
LedgerAgent: Estado estructurado para agentes de llamada de herramientas adherentes a la política
LedgerAgent introduce un libro mayor estructurado para mantener los estados de las tareas por separado en agentes de llamada de herramientas. Convierte los estados en prompts y aplica restricciones de la política antes de la ejecución de herramientas, reduciendo las violaciones de la política y mejorando el rendimiento en dominios de atención al cliente.