Les développeurs de TrueForge, un harnais d'agents open-source modèle-neutre, l'ont comparé à Claude Managed Agents en utilisant le benchmark DevRev Enterprise-Bench. La comparaison a révélé que TrueForge peut égaler le taux de résolution des plateformes gérées tout en réduisant significativement la consommation de ressources.

  • TrueForge + Opus 4.8 a résolu 11/14 tâches avec 63 % moins de tokens et un coût par exécution réduit de 30 % par rapport à Claude Managed Agents + Opus 4.8.
  • Le gain d'efficacité provient de la réduction du transport du contexte, de la compaction et du nombre inférieur d'appels d'outils (moyenne de 19 contre 32).
  • TrueForge + GLM-5.2 a atteint un taux de résolution légèrement supérieur de 11,7/14 tâches à environ 75 % de coût inférieur par rapport à la référence Claude.
  • Le harnais sous licence MIT prend en charge les points de terminaison compatibles OpenAI, les sous-agents et les sessions persistantes, mais manque d'outils de traçage de première classe.

Les auteurs soulignent que le maintien du modèle neutre au moment de l'exécution permet aux utilisateurs d'optimiser indépendamment l'efficacité des tokens et le rapport qualité-prix en sélectionnant différents modèles.