Sebuah kerangka kerja koroutin-bridge baru untuk agen yang menggunakan alat memenangkan Jalur 2 dari evaluasi CAR-bench, mencapai skor Pass@3 sebesar 60,0% pada set uji tersembunyi resmi. Sistem ini memisahkan pemanggilan model dari putaran balik alat dengan membuat model menghasilkan program Python yang memblokir dan melanjutkan kembali di antara pertukaran evaluator.

  • Agen menggunakan median dua panggilan model terhadap tujuh giliran agen per tugas, menyelesaikan tugas dalam median 1,8 detik latensi model pada Cerebras gpt-oss-120b.
  • Sistem ini mencapai 4,5 kali lipat dari baseline penyelenggara dengan biaya terendah dan latensi tugas median tercepat (3,14 s) di antara entri yang mencetak skor di atas baseline tersebut.
  • Kerangka kerja yang tidak berubah mereproduksi Pass@3 identik sebesar 60,0% pada GPT-5.5 di Jalur Terbuka, menyamai agen model terdepan.
  • Satu prompt statis melayani 78% token input dari cache, secara signifikan mengurangi komputasi input nominal.

Pendekatan ini memaksakan kepatuhan tanpa biaya penalaran dengan mengkodekan kebijakan deterministik sebagai logika di lapisan alat, bukan aturan dalam prompt.