오픈소스 모델 중립형 에이전트 허브인 TrueForge의 개발자들은 DevRev Enterprise-Bench를 사용하여 이를 Claude Managed Agents와 벤치마킹했습니다. 비교 결과, TrueForge는 관리되는 플랫폼의 해결률을 맞추면서도 자원 소비를 크게 줄일 수 있는 것으로 나타났습니다.
- TrueForge + Opus 4.8은 Claude Managed Agents + Opus 4.8 대비 토큰을 63% 덜 사용하고 실행당 비용을 30% 낮추며 14개 작업 중 11개를 해결했습니다.
- 효율성 향상은 컨텍스트 전달 및 압축 감소, 도구 호출 횟수 감소(평균 19회 대 32회)에서 비롯됩니다.
- TrueForge + GLM-5.2는 Claude 기준선 대비 약 75% 낮은 비용으로 14개 작업 중 11.7개의 약간 더 높은 해결률을 달성했습니다.
- MIT 라이선스를 받는 이 허브는 OpenAI 호환 엔드포인트, 서브에이전트 및 지속 세션을 지원하지만 첫-class 추적 도구 지원은 부족합니다.
저자들은 런타임을 모델 중립적으로 유지함으로써 사용자가 서로 다른 모델을 선택하여 토큰 효율성과 가격 대비 성능을 독립적으로 최적화할 수 있다고 강조합니다.