Un nuevo marco de puente de corutinas para agentes que utilizan herramientas ganó la Pista 2 de la evaluación CAR-bench, logrando una puntuación de 60.0% Pass@3 en el conjunto de pruebas ocultas oficial. El sistema desacopla la invocación del modelo de los viajes de ida y vuelta de las herramientas haciendo que el modelo emita programas Python que bloquean y reanudan a través de los intercambios del evaluador.

  • El agente utiliza una mediana de dos llamadas al modelo frente a siete turnos del agente por tarea, resolviendo tareas en una mediana de 1.8 segundos de latencia del modelo en Cerebras gpt-oss-120b.
  • Logró 4.5 veces la línea base del organizador con el costo estimado más bajo y la latencia mediana de tarea más rápida (3.14 s) entre las entradas que superaron esa línea base.
  • El marco sin cambios reprodujo un Pass@3 idéntico de 60.0% en GPT-5.5 en la pista abierta, igualando a los agentes de modelos de vanguardia.
  • Un único prompt estático sirvió al 78% de los tokens de entrada desde la caché, reduciendo significativamente el cómputo nominal de entrada.

El enfoque impone cumplimiento sin costo de razonamiento codificando políticas deterministas como lógica en la capa de herramientas en lugar de reglas del prompt.