PhoneBuddy combina entornos de aplicaciones reales y simuladas para entrenar modelos abiertos para el uso de teléfonos. Mejora las tasas de éxito de tareas del 36,67% al 45,33% en teléfonos reales y del 60,3% al 83,2% en AndroidWorld, mostrando que el entrenamiento con aplicaciones simuladas complementa pero no reemplaza el RL con aplicaciones reales.
PhoneBuddy: Entrenamiento de modelos abiertos para uso agénico en teléfonos
ThinkingBox mide la fiabilidad de los agentes calificando el estado del backend y los efectos secundarios
Microsoft y Hugging Face lanzaron ThinkingBox, un benchmark que evalúa a los agentes de IA calificando su impacto en estados de base de datos aislados en lugar de solo sus llamadas a herramientas o respuestas finales. En 507 flujos de trabajo empresariales con estado ejecutados 20 veces cada uno contra varios modelos LLM, el estudio encontró que, aunque muchos agentes producen llamadas a herramientas válidas, frecuentemente dejan valores incorrectos, efectos extra no deseados o efectos requeridos faltantes en el backend.
El desafío de reproducciones abiertas de ICML 2026 encuentra que el 23% de los artículos examinados tienen afirmaciones falsificadas
El desafío de reproducciones abiertas de ICML 2026, celebrado del 15 de julio al 2 de agosto de 2026, involucró a la comunidad en la reproducción de artículos aceptados utilizando agentes de IA y supervisión humana. El esfuerzo resultó en la auditoría abierta más grande, afirmación por afirmación, de una conferencia de aprendizaje automático hasta la fecha.
¿Estamos listos para un sistema de memoria nativo para agentes?
Un nuevo estudio descompone la memoria del agente en cuatro módulos principales y evalúa 12 sistemas a través de cinco cargas de trabajo de referencia. No encuentra que una única arquitectura domine, con el rendimiento dependiente de la alineación con los cuellos de botella de la carga de trabajo, y revela que el mantenimiento localizado es más rentable que la reorganización global.
AgentCIBench evalúa los riesgos de privacidad en agentes de uso informático
AgentCIBench presenta un benchmark para evaluar los riesgos de privacidad en agentes de uso informático. Identifica tres modos de fallo clave: co-localización visual, exceso de información por ambigüedad de tarea y desalineación del destinatario, y encuentra que 11 de los 15 agentes evaluados filtran datos personales en más del 50% de los escenarios, con una filtración promedio del 67.9%.
LRE: Memoria de agente de pocos kilobytes con costo neuronal cero
LRE es un sistema solo de CPU, sin modelo de lenguaje, que aprende qué unidades del historial de interacción son fundamentales. Supera a las líneas base en el equilibrio entre precisión y costo, reduciendo el tamaño máximo del contexto hasta un 52% y mejorando la finalización de tareas en un 37% en algunos casos. LRE logra una calidad de respuesta superior con un 68% menos de tokens y no requiere anotaciones ni cómputo neuronal para el entrenamiento.