Un análisis de tareas de agentes de codificación utilizando GPT-5.6-sol y Codex CLI 0.144.1 demuestra que reducir los tokens de contexto en un 90% no resulta en ahorros proporcionales del costo total de la tarea.
- Una benchmark de reescritura de repositorios que compara sin plugin, Ponytail y plugins RTK aislados mostró diferencias mínimas de costo a pesar de la variación de tokens.
- Ponytail logró un 7.56% menos de tokens y un 8.87% menos de costo, pero requirió una duración un 13.51% mayor en comparación con la línea base.
- RTK resultó en un 13.20% más de tokens y un 7.18% más de costo con un 44% más de rondas que la línea base.
- La entrada en caché representó el 96.46% de los tokens y el 63.91% del costo, mientras que la salida del modelo fue solo el 0.38% de los tokens.
- Una alta varianza entre ejecuciones (30-51%) indica que los pequeños cambios medios son insignificantes en comparación con las fluctuaciones naturales.
El autor argumenta que las herramientas de ahorro de tokens deben evaluarse en términos de costo por tarea completada verificada, incluyendo la varianza de ejecuciones repetidas, latencia y métricas de calidad.