El Proyecto Android Open Harness (AOHP) es un arnés de agente a nivel del sistema operativo de código abierto construido sobre el Proyecto de Código Abierto de Android. Aborda la discrepancia entre los sistemas operativos actuales centrados en aplicaciones y las necesidades de los agentes de IA autónomos, tratando a los agentes como actores de primer nivel del SO. El diseño introduce tres mecanismos clave: composición de servicios personalizados, interfaces eficientes para agentes y flujo seguro de información. Estas características permiten interfaces de usuario adaptables y entornos de ejecución amigables para agentes, preservando al mismo tiempo el ecosistema existente de Android. Los experimentos preliminares en tareas desafiantes demuestran mejoras significativas en el rendimiento en comparación con los sistemas convencionales. Específicamente, AOHP logró un aumento del 21.12% en las tasas de finalización de tareas en comparación con los métodos base. También redujo los costos de ejecución de tokens en un 51.55%, destacando sus ganancias de eficiencia. Además, el sistema mostró una mejor cumplimiento de las políticas de seguridad durante las interacciones mediadas por agentes.
AOHP: Un arnés de agente a nivel del sistema operativo de código abierto para interacciones personalizadas, eficientes y seguras
HealthClaw: agente de código abierto con memoria autoevolutiva para la gestión longitudinal de la salud personal
Los investigadores desarrollaron HealthClaw, una arquitectura de agente de código abierto diseñada para actualizar el soporte a medida que cambian las rutinas, preferencias, mediciones y riesgos de una persona con el tiempo. Separa las reglas de seguridad compartidas y el conocimiento médico de la memoria longitudinal privada que contiene hechos del perfil, procedimientos reutilizables y rastros episódicos.
Tmax: Una receta RL sencilla para agentes terminales
Tmax presenta la mejor receta RL de código abierto para agentes terminales, alcanzando un 27% en Terminal-Bench 2.0 con solo 9B parámetros. Utiliza una taxonomía de datos novedosa para generar más de 2.5x entornos terminales que los conjuntos de datos anteriores, permitiendo un entrenamiento eficiente con una receta sencilla basada únicamente en el resultado. El conjunto de datos, los modelos y el código se han publicado como código abierto en https://github.com/hamishivi/tmax.
Taxonomía técnica de protocolos de comunicación de agentes LLM
Una nueva taxonomía clasifica los protocolos de comunicación de agentes LLM en cinco dimensiones: contraparte, carga útil, estado de interacción, mecanismo de descubrimiento y flexibilidad del esquema. El análisis muestra que las cargas útiles híbridas, la persistencia del estado de sesión y la negociación de esquemas en tiempo de ejecución son comunes, mientras que el descubrimiento descentralizado sigue siendo raro. El estudio predice una convergencia a corto plazo hacia protocolos unificados de agente-a-agente y agente-a-contexto, y una evolución a largo plazo hacia una pila de protocolos federada y en capas.
OpenAI afirma que un resultado sobre singularidad de Navier-Stokes asistido por IA se logró con 10.000 agentes
Cuentas afiliadas a OpenAI informaron que un esfuerzo asistido por IA produjo un resultado relacionado con el problema de existencia y regularidad de Navier-Stokes, uno de los Problemas del Milenio. La afirmación establece que aproximadamente 10.000 agentes colaboraron en la tarea después de ser entrenados durante aproximadamente un año utilizando aprendizaje por refuerzo multiagente.
El sistema interno de OpenAI demuestra que las ecuaciones de Navier-Stokes pueden desarrollar singularidades en tiempo finito
OpenAI informa que un sistema de IA interno ha producido una prueba que muestra que la dinámica de las ecuaciones de Navier-Stokes para el movimiento de fluidos puede desarrollar una singularidad en tiempo finito. La solución, derivada por un sistema multiagente impulsado por un modelo significativamente más capaz que GPT-6 Astra, establece la afirmación "C" de la formulación del Premio Millennium.