Os desenvolvedores do TrueForge, uma estrutura de agentes modelo-neutra e de código aberto, a compararam por meio de benchmark contra os Agentes Gerenciados do Claude usando o DevRev Enterprise-Bench. A comparação revelou que o TrueForge pode igualar a taxa de resolução das plataformas gerenciadas enquanto reduz significativamente o consumo de recursos.
- TrueForge + Opus 4.8 resolveu 11/14 tarefas com 63% menos tokens e 30% de custo menor por execução em comparação aos Agentes Gerenciados do Claude + Opus 4.8.
- O ganho de eficiência decorre da redução na transmissão de contexto, compactação e menos chamadas de ferramentas (média de 19 contra 32).
- TrueForge + GLM-5.2 alcançou uma taxa de resolução ligeiramente maior de 11,7/14 tarefas com custo aproximadamente 75% menor que a linha de base do Claude.
- A estrutura sob licença MIT suporta endpoints compatíveis com OpenAI, subagentes e sessões persistentes, mas carece de ferramentas de rastreamento de primeira classe.
Os autores destacam que manter o modelo no tempo de execução como neutro permite que os usuários otimizem independentemente a eficiência de tokens e o custo-benefício ao selecionar modelos diferentes.