Sebuah kerangka kerja koroutin-bridge baru untuk agen yang menggunakan alat memenangkan Jalur 2 dari evaluasi CAR-bench, mencapai skor Pass@3 sebesar 60,0% pada set uji tersembunyi resmi. Sistem ini memisahkan pemanggilan model dari putaran balik alat dengan membuat model menghasilkan program Python yang memblokir dan melanjutkan kembali di antara pertukaran evaluator.
- Agen menggunakan median dua panggilan model terhadap tujuh giliran agen per tugas, menyelesaikan tugas dalam median 1,8 detik latensi model pada Cerebras gpt-oss-120b.
- Sistem ini mencapai 4,5 kali lipat dari baseline penyelenggara dengan biaya terendah dan latensi tugas median tercepat (3,14 s) di antara entri yang mencetak skor di atas baseline tersebut.
- Kerangka kerja yang tidak berubah mereproduksi Pass@3 identik sebesar 60,0% pada GPT-5.5 di Jalur Terbuka, menyamai agen model terdepan.
- Satu prompt statis melayani 78% token input dari cache, secara signifikan mengurangi komputasi input nominal.
Pendekatan ini memaksakan kepatuhan tanpa biaya penalaran dengan mengkodekan kebijakan deterministik sebagai logika di lapisan alat, bukan aturan dalam prompt.