Pengembang TrueForge, sebuah kerangka kerja agen netral-model sumber terbuka, melakukan benchmarking terhadapnya dibandingkan dengan Claude Managed Agents menggunakan DevRev Enterprise-Bench. Perbandingan tersebut mengungkapkan bahwa TrueForge dapat menyamai tingkat penyelesaian platform terkelola sambil secara signifikan mengurangi konsumsi sumber daya.
- TrueForge + Opus 4.8 menyelesaikan 11/14 tugas dengan 63% token lebih sedikit dan biaya per jalanan 30% lebih rendah dibandingkan Claude Managed Agents + Opus 4.8.
- Peningkatan efisiensi berasal dari pengurangan pembawa konteks, kompresi, dan panggilan alat yang lebih sedikit (rata-rata 19 dibandingkan 32).
- TrueForge + GLM-5.2 mencapai tingkat penyelesaian sedikit lebih tinggi sebesar 11.7/14 tugas dengan biaya sekitar 75% lebih rendah daripada baseline Claude.
- Kerangka kerja berlisensi MIT mendukung endpoint yang kompatibel dengan OpenAI, subagen, dan sesi persisten tetapi tidak memiliki alat pelacakan kelas pertama.
Para penulis menyoroti bahwa menjaga netralitas model runtime memungkinkan pengguna mengoptimalkan efisiensi token dan kinerja harga secara independen dengan memilih model yang berbeda.