Les auteurs présentent Growing Harness, un paradigme d'entraînement qui apprend la structure de contrôle d'un agent à partir du feedback de la tâche plutôt que de s'appuyer sur des harnesses standard lourdes en contexte. En convertissant les décisions de contrôle récurrentes en code exécutable et en réservant les appels LLM au raisonnement sémantique, la méthode vise à créer des agents spécialistes réutilisables.
- Growing Harness utilise un squelette sans stratégie avec des interfaces fixes, localisant les échecs via des traces d'exécution au niveau des fonctions.
- Un optimiseur répare conjointement les fenêtres d'échecs, tandis qu'une porte de priorité au succès annule les modifications qui nuisent à la capacité antérieure.
- Sur BrowseComp-Plus et WebArena-Verified avec des modèles allant de 4B à 120B paramètres, il a obtenu le taux de réussite moyen le plus élevé dans cinq des six configurations.
- Il réduit les appels LLM de 76,0 à 91,8 % et le coût d'inférence des agents déployés de 74,4 à 98,6 % par rapport à un agent Tool-Calling.
- Sur WebArena-Verified, la réussite reste stable entre 44,7 et 45,3 % à travers les échelles de modèles, tandis que Tool-Calling chute à 6,7 % avec le modèle 4B.
La croissance persistante du programme déplace le contrôle récurrent hors du contexte du modèle vers du code peu coûteux, permettant aux agents de rester efficaces même lorsqu'ils sont déployés avec des modèles plus petits.