ツール利用エージェント向けの新しいコルーチンブリッジハーネスが、CAR-bench評価のトラック2で優勝し、公式の非公開テストセットにおいて60.0%のPass@3スコアを達成した。このシステムは、モデルが評価者とのやり取り間でブロックおよび再開するPythonプログラムを出力することで、モデル呼び出しとツールの往復を分離している。
- エージェントはタスクごとに7回のエージェントターンに対して中央値2回のモデル呼び出しを使用し、Cerebras gpt-oss-120b上で中央値1.8秒のモデルレイテンシでタスクを解決した。
- 同ベースライン以上のスコアを獲得したエントリーの中で、最低推定コストと最速中央値タスクレイテンシ(3.14秒)を実現し、主催者のベースラインの4.5倍の性能を達成した。
- 変更されていないハーネスは、OpenトラックにおいてGPT-5.5でも同様の60.0% Pass@3を再現し、フロンティアモデルのエージェントと同等の性能を示した。
- 単一の静的プロンプトが78%の入力トークンをキャッシュから提供し、名目上の入力計算量を大幅に削減した。
このアプローチは、決定論的ポリシーをプロンプトルールではなくツール層のロジックとしてエンコードすることで、ゼロの推論コストでコンプライアンスを強制する。