WorldLines presenta una evaluación basada en proyectos para la asistencia doméstica encarnada en horizontes temporales largos, capturando secuencias extendidas del hogar con diálogos, acciones y cambios de estado. Permite muestras vinculadas a evidencia para Memoria QA y Planificación de Tareas Encarnadas, y propone ObsMem, un marco de memoria basado en observadores que soporta memorias conscientes de la visibilidad y decisiones conscientes del estado. Los experimentos destacan los desafíos en la observabilidad parcial y la traducción de memoria, con ObsMem proporcionando una arquitectura de referencia más sólida para este tipo de entornos.
WorldLines: Evaluación de la memoria de agentes encarnados en horizontes temporales largos
AtomMem: Sistema de memoria simple y efectivo para agentes LLM
AtomMem introduce un sistema de memoria que almacena hechos atómicos de alto valor procedentes de interacciones extensas. Utiliza estructuras de eventos jerárquicas y perfiles temporales para capturar contextos episódicos coherentes y rastrear atributos de usuario en evolución, permitiendo una evolución de la memoria estable y eficiente. Los experimentos en el benchmark LoCoMo muestran que AtomMem alcanza un rendimiento de vanguardia en tareas de razonamiento.
GEMS: Las restricciones geométricas permiten la superposición multi-semántica en LLMs
GEMS permite la superposición sin entrenamiento de múltiples direcciones semánticas en LLMs abordando la desviación distribucional y la interferencia direccional mediante restricciones geométricas. En GSM8K, mantiene una precisión del 98% con tres direcciones no matemáticas, mientras que la adición sin restricciones cae al 4%; en Wikitext-2, aumenta el PPL solo un 2.2%.
ScenA: Generación de Escenas de Audio Multi-Parlante Basada en Referencias
ScenA condiciona un modelo base de texto a audio en múltiples voces de referencia y una descripción de escena en lenguaje natural para generar conversaciones realistas multi-parlante. Aborda el problema del 'Atajo de Referencia' mediante un programa de entrenamiento con sesgo hacia alto ruido, asegurando que la asignación del hablante dependa de las indicaciones de texto en lugar de la similitud acústica. Evaluado en CoVoMix2-Dialogue, ScenA supera a los sistemas existentes en la vinculación de hablantes y produce audio rico y naturalista con habla superpuesta y ruido ambiental.
Turing-RL: Aprendizaje de simuladores de usuarios con recompensas de Turing
Turing-RL introduce un método de aprendizaje por refuerzo que utiliza un juez basado en LLM para evaluar qué tan indistinguibles son las respuestas generadas de las entradas reales del usuario. Supera a los métodos base tanto en evaluaciones con LLM como humanas en los dominios de chat y foros de Reddit, demostrando que optimizar la indistinguibilidad mejora el rendimiento del simulador de usuarios.
El marco EARS mejora la fiabilidad de los sistemas multi-agente
EARS introduce la abstención explicativa en sub-agentes para mejorar la fiabilidad en sistemas multi-agente a gran escala. Al proporcionar razones de fallo accionables a los coordinadores, EARS aumenta la tasa general de respuestas exitosas del 68.5% al 78.9% en un asistente de comercio electrónico en producción.