Uma nova estrutura de ponte de coroutine para agentes que utilizam ferramentas venceu o Track 2 da avaliação CAR-bench, alcançando uma pontuação de Pass@3 de 60,0% no conjunto oficial de testes ocultos. O sistema desacopla a invocação do modelo das viagens de ida e volta das ferramentas, fazendo com que o modelo emita programas Python que bloqueiam e retomam a execução entre as trocas do avaliador.
- O agente utiliza uma mediana de duas chamadas ao modelo contra sete rodadas do agente por tarefa, resolvendo tarefas em uma mediana de 1,8 segundos de latência do modelo no Cerebras gpt-oss-120b.
- Ele alcançou 4,5 vezes a linha de base dos organizadores com o menor custo estimado e a latência mediana mais rápida por tarefa (3,14 s) entre as entradas que superaram essa linha de base.
- A estrutura inalterada reproduziu um Pass@3 idêntico de 60,0% no GPT-5.5 na trilha Open, igualando agentes de modelos de fronteira.
- Um único prompt estático serviu 78% dos tokens de entrada a partir do cache, reduzindo significativamente o custo computacional nominal de entrada.
A abordagem impõe conformidade sem custo de raciocínio, codificando políticas determinísticas como lógica na camada de ferramentas em vez de regras no prompt.