Uma análise de tarefas de agentes de codificação usando GPT-5.6-sol e Codex CLI 0.144.1 demonstra que reduzir os tokens de contexto em 90% não resulta em economias proporcionais de custo para a tarefa completa.
- Um benchmark de reescrita de repositório comparando sem plugin, Ponytail e plugins RTK isolados mostrou diferenças mínimas de custo apesar da variação de tokens.
- Ponytail alcançou 7,56% menos tokens e 8,87% de custo menor, mas exigiu duração 13,51% mais longa em comparação com a linha de base.
- RTK resultou em 13,20% mais tokens e 7,18% de custo maior com 44% mais rodadas do que a linha de base.
- A entrada em cache representou 96,46% dos tokens e 63,91% do custo, enquanto a saída do modelo foi apenas 0,38% dos tokens.
- Alta variabilidade entre execuções (30-51%) indica que pequenas mudanças na média são insignificantes em comparação com oscilações naturais.
O autor argumenta que ferramentas de economia de tokens devem ser avaliadas com base no custo por tarefa concluída verificada, incluindo variabilidade de rodadas repetidas, latência e métricas de qualidade.