Pesquisadores propõem o Living-Harness, um harness de agente que se autoevolui e converte trajetórias concluídas e sinais do avaliador em evidência posterior para atualizações limitadas do harness. Guiado por um Evolution-SOP, o sistema extrai abstrações de episódios e evidências estruturadas de atualização para escrever memória episódica e grafos de estado.
- O Living-Harness registra condições de gatilho, padrões de falha e ações de recuperação como memória episódica.
- Ele mantém um grafo de estado com nós, arestas de reparo e regras de transição para reparos procedurais.
- O estado do harness atualizado é recuperado para guiar interações futuras enquanto as ferramentas e o contexto base permanecem congelados.
- Em oito ambientes interativos derivados do τ²-Bench e MultiWOZ-2.4, ele melhora o Pass@1 médio em relação à linha de base mais forte em 10,07 e 9,91 pontos percentuais, respectivamente.
O estado do harness evoluído suporta reutilização apenas por recuperação entre diferentes backbones de modelo, permitindo que os reparos procedurais se acumulem ao longo dos ciclos de evolução.