Un nuevo estudio descompone la memoria del agente en cuatro módulos principales y evalúa 12 sistemas a través de cinco cargas de trabajo de referencia. No encuentra que una única arquitectura domine, con el rendimiento dependiente de la alineación con los cuellos de botella de la carga de trabajo, y revela que el mantenimiento localizado es más rentable que la reorganización global.
¿Estamos listos para un sistema de memoria nativo para agentes?
El desafío de reproducciones abiertas de ICML 2026 encuentra que el 23% de los artículos examinados tienen afirmaciones falsificadas
El desafío de reproducciones abiertas de ICML 2026, celebrado del 15 de julio al 2 de agosto de 2026, involucró a la comunidad en la reproducción de artículos aceptados utilizando agentes de IA y supervisión humana. El esfuerzo resultó en la auditoría abierta más grande, afirmación por afirmación, de una conferencia de aprendizaje automático hasta la fecha.
PhoneBuddy: Entrenamiento de modelos abiertos para uso agénico en teléfonos
PhoneBuddy combina entornos de aplicaciones reales y simuladas para entrenar modelos abiertos para el uso de teléfonos. Mejora las tasas de éxito de tareas del 36,67% al 45,33% en teléfonos reales y del 60,3% al 83,2% en AndroidWorld, mostrando que el entrenamiento con aplicaciones simuladas complementa pero no reemplaza el RL con aplicaciones reales.
AgentCIBench evalúa los riesgos de privacidad en agentes de uso informático
AgentCIBench presenta un benchmark para evaluar los riesgos de privacidad en agentes de uso informático. Identifica tres modos de fallo clave: co-localización visual, exceso de información por ambigüedad de tarea y desalineación del destinatario, y encuentra que 11 de los 15 agentes evaluados filtran datos personales en más del 50% de los escenarios, con una filtración promedio del 67.9%.
LRE: Memoria de agente de pocos kilobytes con costo neuronal cero
LRE es un sistema solo de CPU, sin modelo de lenguaje, que aprende qué unidades del historial de interacción son fundamentales. Supera a las líneas base en el equilibrio entre precisión y costo, reduciendo el tamaño máximo del contexto hasta un 52% y mejorando la finalización de tareas en un 37% en algunos casos. LRE logra una calidad de respuesta superior con un 68% menos de tokens y no requiere anotaciones ni cómputo neuronal para el entrenamiento.
Beaver: Arnés de agente para curación científica a partir de fuentes multimodales
Beaver es un arnés de agente que extrae información estructurada de artículos científicos integrando herramientas de evidencia multimodal, andamiaje de tareas y autoresearch basado en artefactos. Alcanza 81.0 en la Puntuación de Atributos con Referencia Dorada, superando a agentes de vanguardia por más de 23 puntos, con ganancias clave en atributos de alto valor que requieren razonamiento cross-modal.