Анализ задач кодинговых агентов с использованием GPT-5.6-sol и Codex CLI 0.144.1 демонстрирует, что сокращение контекстных токенов на 90% не приводит к пропорциональной экономии затрат на выполнение всей задачи.

  • Бенчмарк переписывания репозитория, сравнивающий отсутствие плагина, Ponytail и изолированные RTK плагины, показал минимальные различия в затратах несмотря на вариативность токенов.
  • Ponytail обеспечил на 7.56% меньше токенов и на 8.87% ниже затрат, но потребовал на 13.51% больше времени по сравнению с базовой линией.
  • RTK привел к увеличению токенов на 13.20% и росту затрат на 7.18% при на 44% большем количестве раундов по сравнению с базовой линией.
  • Кэшированный ввод составил 96.46% токенов и 63.91% затрат, тогда как вывод модели — лишь 0.38% токенов.
  • Высокая дисперсия от запуска к запуску (30-51%) указывает на то, что небольшие изменения среднего значения несущественны по сравнению с естественными колебаниями.

Автор утверждает, что инструменты для экономии токенов следует оценивать по стоимости за один подтвержденный выполненный task, включая дисперсию повторных запусков, задержки и метрики качества.