Los desarrolladores de TrueForge, una herramienta de agentes modelo-neutral de código abierto, la compararon contra Claude Managed Agents utilizando DevRev Enterprise-Bench. La comparación reveló que TrueForge puede igualar la tasa de resolución de las plataformas gestionadas mientras reduce significativamente el consumo de recursos.

  • TrueForge + Opus 4.8 resolvió 11/14 tareas con un 63% menos de tokens y un 30% menos de costo por ejecución en comparación con Claude Managed Agents + Opus 4.8.
  • La ganancia de eficiencia proviene de la reducción del contexto mantenido, la compacción y menos llamadas a herramientas (promediando 19 frente a 32).
  • TrueForge + GLM-5.2 logró una tasa de resolución ligeramente mayor de 11.7/14 tareas con aproximadamente un 75% menos de costo que la línea base de Claude.
  • La herramienta con licencia MIT soporta puntos finales compatibles con OpenAI, subagentes y sesiones persistentes pero carece de herramientas de trazabilidad de primera clase.

Los autores destacan que mantener el modelo neutral en tiempo de ejecución permite a los usuarios optimizar independientemente la eficiencia de tokens y el rendimiento por precio seleccionando diferentes modelos.