Los investigadores proponen Living-Harness, un arnés de agente que se autoevoluciona y convierte trayectorias completadas y señales del evaluador en evidencia posterior para actualizaciones acotadas del arnés. Guiado por una Evolution-SOP, el sistema extrae abstracciones de episodios y evidencia estructurada de actualización para escribir memoria episódica y grafos de estado.
- Living-Harness registra condiciones de activación, patrones de fallo y acciones de recuperación como memoria episódica.
- Mantiene un grafo de estado de nodos, bordes de reparación y reglas de transición para reparaciones procedimentales.
- El estado actualizado del arnés se recupera para guiar interacciones futuras mientras las herramientas y el contexto base permanecen congelados.
- En ocho entornos interactivos derivados de τ²-Bench y MultiWOZ-2.4, mejora el Pass@1 promedio sobre la línea base más fuerte en 10,07 y 9,91 puntos porcentuales respectivamente.
El estado del arnés evolucionado admite reutilización solo mediante recuperación a través de diferentes backbones de modelo, permitiendo que las reparaciones procedimentales se acumulen a lo largo de los ciclos de evolución.