قام مطورو TrueForge، وهو إطار عمل مفتوح المصدر لوكلاء محايد للنماذج، بمقارنته بـ وكلاء Claude المُدارين باستخدام DevRev Enterprise-Bench. أظهرت المقارنة أن TrueForge يمكنها مساواة معدل حل المنصات المُدارة مع تقليل استهلاك الموارد بشكل كبير.

  • حقق TrueForge + Opus 4.8 نسبة حل قدرها 11/14 من المهام، مع استخدام عدد رموز أقل بنسبة 63% وتكلفة أقل لكل تشغيل بنسبة 30% مقارنة بـ وكلاء Claude المُدارين + Opus 4.8.
  • يعود مكسب الكفاءة إلى تقليل حمل السياق، وضغطه، وعدد استدعاءات الأدوات الأقل (متوسط 19 مقابل 32).
  • حقق TrueForge + GLM-5.2 معدل حل أعلى قليلاً قدره 11.7/14 من المهام بتكلفة أقل بنحو 75% من الأساس المرجعي لـ Claude.
  • يدعم الإطار المرخص بموجب MIT نقاط النهاية المتوافقة مع OpenAI، والوكلاء الفرعيين، والجلسات الدائمة، لكنه يفتقر إلى أدوات تتبع متكاملة.

يؤكد المؤلفون أن الحفاظ على حياد النموذج في وقت التشغيل يسمح للمستخدمين بتحسين الكفاءة من حيث الرموز والأداء مقابل السعر بشكل مستقل من خلال اختيار نماذج مختلفة.