GEMS permite la superposición sin entrenamiento de múltiples direcciones semánticas en LLMs abordando la desviación distribucional y la interferencia direccional mediante restricciones geométricas. En GSM8K, mantiene una precisión del 98% con tres direcciones no matemáticas, mientras que la adición sin restricciones cae al 4%; en Wikitext-2, aumenta el PPL solo un 2.2%.
GEMS: Las restricciones geométricas permiten la superposición multi-semántica en LLMs
AtomMem: Sistema de memoria simple y efectivo para agentes LLM
AtomMem introduce un sistema de memoria que almacena hechos atómicos de alto valor procedentes de interacciones extensas. Utiliza estructuras de eventos jerárquicas y perfiles temporales para capturar contextos episódicos coherentes y rastrear atributos de usuario en evolución, permitiendo una evolución de la memoria estable y eficiente. Los experimentos en el benchmark LoCoMo muestran que AtomMem alcanza un rendimiento de vanguardia en tareas de razonamiento.
El marco EARS mejora la fiabilidad de los sistemas multi-agente
EARS introduce la abstención explicativa en sub-agentes para mejorar la fiabilidad en sistemas multi-agente a gran escala. Al proporcionar razones de fallo accionables a los coordinadores, EARS aumenta la tasa general de respuestas exitosas del 68.5% al 78.9% en un asistente de comercio electrónico en producción.
Destilación de continuación guiada por habilidades para agentes GUI
SGCD introduce un marco iterativo para mejorar los agentes GUI abordando las brechas de supervisión en estados fuera de trayectoria. Extrae habilidades tanto de rollouts exitosos como fallidos, utilizándolas para guiar continuaciones de políticas que se mezclan con trayectorias expertas. En OSWorld-Verified, SGCD aumenta las tasas de éxito de tres modelos base desde el 30% bajo hasta más del 50%.
AdsMind: Sistema multiagente fundamentado en física para el descubrimiento de adsorción
AdsMind es un sistema multiagente de bucle cerrado que utiliza campos de fuerza basados en aprendizaje automático y retroalimentación para corregir errores en las búsquedas de configuraciones de adsorción sobre superficies catalíticas. Alcanza tasas de éxito del 100% y 98.8% en los benchmarks AA20 y OCD-GMAE62, reduce la dispersión energética 14 veces en comparación con las líneas base y mantiene los signos correctos de energía de adsorción en la validación DFT, superando a los agentes LLM de bucle abierto.
SkillMigrator: Patrones de interacción transferibles para la eficiencia de agentes web
SkillMigrator aprende habilidades web reutilizables al emparejar estructuras de diseño en lugar de referencias a elementos. Almacena cada habilidad como un patrón de interacción transferible con un boceto estructural, lo que permite una transferencia eficiente de habilidades entre sitios. En comparación con los métodos más avanzados, reduce el recuento promedio de acciones del LLM en un 8-10% en WebArena y Mind2Web a tasas de éxito equivalentes.