Un nouveau harnais de pont de coroutine pour les agents utilisant des outils a remporté la Piste 2 de l'évaluation CAR-bench, atteignant un score de Pass@3 de 60,0 % sur l'ensemble de test caché officiel. Le système découple l'appel du modèle des allers-retours d'outils en faisant émettre au modèle des programmes Python qui bloquent et reprennent l'exécution à travers les échanges avec l'évaluateur.
- L'agent utilise une médiane de deux appels de modèle pour sept tours d'agent par tâche, résolvant les tâches avec une latence médiane du modèle de 1,8 seconde sur Cerebras gpt-oss-120b.
- Il a atteint 4,5 fois la ligne de base des organisateurs au coût estimé le plus bas et à la latence médiane de tâche la plus rapide (3,14 s) parmi les entrées ayant dépassé cette ligne de base.
- Le harnais inchangé a reproduit un Pass@3 identique de 60,0 % sur GPT-5.5 dans la piste ouverte, égalant les agents de modèles de pointe.
- Une invite statique unique a servi 78 % des jetons d'entrée depuis le cache, réduisant significativement le calcul d'entrée nominal.
L'approche impose la conformité sans coût de raisonnement en encodant des politiques déterministes sous forme de logique dans la couche d'outils plutôt que dans les règles d'invite.