도구 사용 에이전트를 위한 새로운 코루틴-브리지 하니스가 CAR-bench 평가의 트랙 2를 우승했으며, 공식 숨겨진 테스트 세트에서 60.0%의 Pass@3 점수를 달성했습니다. 이 시스템은 모델이 평가자 간 교환을 가로질러 차단하고 재개하는 Python 프로그램을 생성하도록 함으로써 모델 호출과 도구 왕복을 분리합니다.
- 에이전트는 작업당 7번의 에이전트 턴에 대해 중간값 2회의 모델 호출을 사용하며, Cerebras gpt-oss-120b에서 중간값 1.8초의 모델 지연 시간으로 작업을 해결합니다.
- 이 하니스는 기준선 이상의 점수를 얻은 참가자 중 최저 추정 비용과 가장 빠른 중간값 작업 지연 시간(3.14초)으로 조직자의 기준선 대비 4.5배의 성능을 달성했습니다.
- 변경되지 않은 하니스가 Open 트랙에서 GPT-5.5에서도 동일한 60.0% Pass@3를 재현하여 최첨단 모델 에이전트와 동률을 이루었습니다.
- 단일 정적 프롬프트가 입력 토큰의 78%를 캐시에서 제공하여 명목상 입력 연산을 크게 줄였습니다.
이 접근 방식은 도구 레이어에서 결정론적 정책을 로직으로 인코딩함으로써 추론 비용 없이 준수를 강제합니다.