Uma análise de tarefas de agentes de codificação usando GPT-5.6-sol e Codex CLI 0.144.1 demonstra que reduzir os tokens de contexto em 90% não resulta em economias proporcionais de custo para a tarefa completa.

  • Um benchmark de reescrita de repositório comparando sem plugin, Ponytail e plugins RTK isolados mostrou diferenças mínimas de custo apesar da variação de tokens.
  • Ponytail alcançou 7,56% menos tokens e 8,87% de custo menor, mas exigiu duração 13,51% mais longa em comparação com a linha de base.
  • RTK resultou em 13,20% mais tokens e 7,18% de custo maior com 44% mais rodadas do que a linha de base.
  • A entrada em cache representou 96,46% dos tokens e 63,91% do custo, enquanto a saída do modelo foi apenas 0,38% dos tokens.
  • Alta variabilidade entre execuções (30-51%) indica que pequenas mudanças na média são insignificantes em comparação com oscilações naturais.

O autor argumenta que ferramentas de economia de tokens devem ser avaliadas com base no custo por tarefa concluída verificada, incluindo variabilidade de rodadas repetidas, latência e métricas de qualidade.