Este artículo presenta la Acumulación de Ventaja Marginal (MAA), una arquitectura de postprocesamiento que aborda la inconsistencia entre lotes en la autoevolución de agentes impulsada por memoria. MAA formaliza la alineación y comparabilidad como condiciones estructurales, utiliza señales diferenciales y promedio móvil exponencial para acumular evidencia firmada por operación, y garantiza la trazabilidad mediante la fusión de identidad semántica. Supera a las líneas base a nivel de lote en 14 de cada 16 configuraciones y reduce el consumo de tokens en aproximadamente un 75%.
Acumulación de Ventaja Marginal para la Autoevolución de Agentes Impulsada por Memoria
OpenBioRQ: Benchmark para la Fidelidad de la Investigación Biomédica Agéntica
OpenBioRQ introduce un benchmark de 12,553 preguntas de investigación biomédica sin resolver en 12 dominios, diseñado para probar la fidelidad y la abstención de los modelos agénticos. Evalúa los modelos en un entorno de uso de herramientas sin claves de respuesta, utilizando evidencia real de seguimiento en lugar de conocimiento paramétrico, y revela un colapso agéntico significativo en las preguntas más difíciles donde las herramientas ya no se utilizan a pesar de ser críticas.
Verificación probabilística eficiente y válida para agentes de IA
Un nuevo marco permite la aplicación segura y probabilística de políticas para agentes de IA en entornos ambiguos. Utiliza optimización robusta distribucional para calcular límites superiores rigurosos sobre las probabilidades de violación de políticas sin asumir independencia de predicados. El método supera a los enfoques anteriores en benchmarks de agentes con terminales y llamadas a herramientas, mejorando el equilibrio entre seguridad y utilidad.
El Administrador de Tareas Reduce la Latencia de Cola en un 14-75% a Escala Empresarial
Un Administrador de Tareas introduce inferencia de prioridad, fusión de eventos relacionados y preempción para habilitar la operación continua en IA empresarial. Reduce la latencia de colas de alta prioridad entre un 14-77% y mejora la corrección de eventos relacionados en más de 20 puntos porcentuales a escala empresarial, abordando el ruido del descubrimiento de agentes como el principal cuello de botella.
AtomMem: Sistema de memoria simple y efectivo para agentes LLM
AtomMem introduce un sistema de memoria que almacena hechos atómicos de alto valor procedentes de interacciones extensas. Utiliza estructuras de eventos jerárquicas y perfiles temporales para capturar contextos episódicos coherentes y rastrear atributos de usuario en evolución, permitiendo una evolución de la memoria estable y eficiente. Los experimentos en el benchmark LoCoMo muestran que AtomMem alcanza un rendimiento de vanguardia en tareas de razonamiento.
GEMS: Las restricciones geométricas permiten la superposición multi-semántica en LLMs
GEMS permite la superposición sin entrenamiento de múltiples direcciones semánticas en LLMs abordando la desviación distribucional y la interferencia direccional mediante restricciones geométricas. En GSM8K, mantiene una precisión del 98% con tres direcciones no matemáticas, mientras que la adición sin restricciones cae al 4%; en Wikitext-2, aumenta el PPL solo un 2.2%.