Les chercheurs présentent Mid-Harness, une méthode qui échantillonne et vérifie les actions candidates à la frontière entre le modèle et le harnais afin d'améliorer la fiabilité de l'exécution dans les agents terminaux. Cette approche alloue du calcul au moment de l'inférence en vérifiant plusieurs options avant d'en transmettre une pour exécution, sans modifier le générateur ni le harnais.

  • Sur TerminalBench-Lite, l'utilisation d'un vérificateur GPT-5.6 Sol avec 8 actions échantillonnées augmente le Pass@1 de 50,00 % à 68,03 % par rapport à l'agent de base.
  • Lorsque TMAX-9B sert de vérificateur, la vérification par paires donne les meilleurs résultats parmi les mécanismes évalués.
  • La distillation des réponses d'un vérificateur plus puissant vers TMAX-9B améliore davantage le Pass@1 sans modifier le générateur d'actions.
  • Combiner l'augmentation des actions et celle des trajectoires avec TMAX-9B permet d'atteindre un taux de réussite plus élevé à un coût estimé en tokens inférieur qu'en générant uniquement plus de trajectoires.

Ces résultats identifient l'augmentation des actions comme une cible prometteuse pour l'augmentation du calcul au moment de l'inférence dans les agents terminaux, améliorant les performances sur des modèles, benchmarks et harnais supplémentaires.