オープンソースのモデルニュートラルなエージェントハーネスであるTrueForgeの開発者は、DevRev Enterprise-Benchを使用してClaude Managed Agentsとのベンチマークを実施した。比較の結果、TrueForgeは管理されたプラットフォームの解決率に追いつきながら、リソース消費を大幅に削減できることが明らかになった。
- TrueForge + Opus 4.8は、Claude Managed Agents + Opus 4.8と比較して、トークン数を63%削減し、1回の実行あたりのコストを30%低減して、14タスク中11タスクを解決した。
- この効率化の要因は、コンテキストの保持と圧縮の削減、およびツール呼び出し回数の減少(平均で19回対32回)によるものである。
- TrueForge + GLM-5.2は、Claudeベースラインと比較して約75%のコスト削減で、14タスク中11.7タスクというわずかに高い解決率を達成した。
- MITライセンスのハーネスはOpenAI互換エンドポイント、サブエージェント、永続セッションをサポートするが、ファーストクラスのトレーシングツールリングは欠如している。
著者らは、ランタイムをモデルニュートラルに保つことで、ユーザーが異なるモデルを選択してトークン効率と価格パフォーマンスを独立して最適化できることを強調している。