Разработчики TrueForge, фреймворка для агентов с открытым исходным кодом, независимого от модели, провели его бенчмаркинг против Claude Managed Agents с использованием DevRev Enterprise-Bench. Сравнение показало, что TrueForge может сопоставить скорость решения задач с управляемыми платформами, значительно снизив потребление ресурсов.

  • TrueForge + Opus 4.8 решил 11/14 задач при использовании на 63% меньше токенов и со стоимостью на 30% ниже за запуск по сравнению с Claude Managed Agents + Opus 4.8.
  • Прирост эффективности обусловлен уменьшением передачи контекста, его сжатия и меньшим количеством вызовов инструментов (в среднем 19 против 32).
  • TrueForge + GLM-5.2 достиг чуть более высокой скорости решения задач — 11.7/14 при стоимости примерно на 75% ниже базового уровня Claude.
  • Фреймворк с лицензией MIT поддерживает совместимые с OpenAI конечные точки, субагентов и постоянные сессии, но не имеет встроенных инструментов трассировки.

Авторы отмечают, что сохранение нейтральности модели во время выполнения позволяет пользователям независимо оптимизировать эффективность использования токенов и соотношение цены и производительности путем выбора различных моделей.