Para penulis memperkenalkan penalaran meta-agentic, sebuah harness waktu inferensi yang menyusun pilihan eksekusi untuk tugas jangka panjang. Sebuah pengontrol mengelola proses dengan mengonsolidasikan kemajuan dan mengirimkan pekerjaan berdasarkan akun eksekusi ringkas daripada riwayat lengkap.

Di ProgramBench, penalaran meta-mencapai 71.5% dengan GPT-5.5 melawan 58.0% untuk Codex, dan 67.2% dengan Opus 4.8 melawan 65.5% untuk Claude Code. Melalui penalaran abstrak, penalaran jangka panjang multi-domain, dan benchmark generasi bukti, ia mendapatkan antara 3.6 hingga 4.2 poin dibandingkan kontrol langsung. Analisis graf artefak menunjukkan peningkatan penggunaan kembali pekerjaan sebelumnya dan cakupan solusi yang lebih tinggi.

Hasilnya menunjukkan bahwa menghabiskan komputasi untuk kontrol terstruktur menjadi semakin penting saat agen menskalakan ke eksekusi yang lebih panjang.