开源模型中立代理框架 TrueForge 的开发者使用 DevRev Enterprise-Bench 将其与 Claude Managed Agents 进行了基准测试。比较结果显示,TrueForge 能够匹配托管平台的解决率,同时显著降低资源消耗。

  • 与 Claude Managed Agents + Opus 4.8 相比,TrueForge + Opus 4.8 在解决 11/14 个任务时,令牌使用量减少了63%,每次运行的成本降低了30%。
  • 效率提升源于上下文携带和压缩的减少,以及工具调用次数的减少(平均为19次,而对比组为32次)。
  • TrueForge + GLM-5.2 以比 Claude 基线低约75%的成本,实现了略高的解决率,达到 11.7/14 个任务。
  • 该采用 MIT 许可证的框架支持 OpenAI 兼容端点、子代理和持久会话,但缺乏一等公民级别的追踪工具。

作者强调,保持运行时模型中立允许用户通过选择不同的模型来独立优化令牌效率和性价比。