Новая среда coroutine-bridge для агентов, использующих инструменты, выиграла Track 2 оценки CAR-bench, достигнув показателя Pass@3 на уровне 60,0% на официальном скрытом тестовом наборе. Система разделяет вызов модели и циклы взаимодействия с инструментами за счёт того, что модель генерирует программы на Python, которые блокируются и возобновляются в ходе обмена данными с оценщиком.

  • Агент использует медианное количество два вызова модели на семь ходов агента на задачу, решая задачи за медианное время 1,8 секунды латентности модели на Cerebras gpt-oss-120b.
  • Он достиг в 4,5 раза больше результата базовой линии организаторов при наименьшей оценочной стоимости и самой быстрой медианной латентности задачи (3,14 с) среди участников, превысивших эту базовую линию.
  • Неразрывная среда воспроизвела идентичный результат Pass@3 60,0% на GPT-5.5 в Open track, сравнявшись с агентами передовых моделей.
  • Один статический промпт обеспечил кэширование 78% входных токенов, что значительно снизило номинальные вычислительные затраты на ввод.

Подход обеспечивает соответствие требованиям без затрат на рассуждения, кодируя детерминированные политики в виде логики на уровне инструментов, а не правил промпта.