一种用于工具使用代理的新型协程桥接框架在CAR-bench评估的Track 2中获胜,在官方隐藏测试集上取得了60.0%的Pass@3分数。该系统通过将模型调用与工具往返过程解耦来实现,让模型生成Python程序,这些程序在评估器交互过程中阻塞并恢复执行。

  • 代理在每个任务中使用中位数为两次模型调用来完成七次代理回合,在Cerebras gpt-oss-120b上解决任务的中位模型延迟时间为1.8秒。
  • 在评分高于基线的条目中,它以最低估计成本和最快中位任务延迟(3.14秒)实现了组织者基线4.5倍的性能。
  • 未更改的框架在Open track中对GPT-5.5复现了相同的60.0% Pass@3成绩,与前沿模型代理持平。
  • 单个静态提示词使78%的输入令牌来自缓存,显著降低了名义输入计算量。

该方法通过将确定性策略编码为工具层的逻辑而非提示规则,以零推理成本强制执行合规性。