Une analyse des tâches d'agent de codage utilisant GPT-5.6-sol et Codex CLI 0.144.1 démontre que la réduction des tokens de contexte de 90 % ne conduit pas à des économies de coûts proportionnelles pour la tâche complète.
- Un benchmark de réécriture de dépôt comparant l'absence de plugin, Ponytail et les plugins RTK isolés a montré des différences de coût minimes malgré la variance des tokens.
- Ponytail a atteint 7,56 % de tokens en moins et un coût inférieur de 8,87 %, mais a nécessité une durée plus longue de 13,51 % par rapport à la ligne de base.
- RTK a entraîné 13,20 % de tokens en plus et un coût supérieur de 7,18 %, avec 44 % de tours de plus que la ligne de base.
- L'entrée mise en cache représentait 96,46 % des tokens et 63,91 % du coût, tandis que la sortie du modèle ne constituait que 0,38 % des tokens.
- Une forte variance d'exécution à l'exécution (30-51 %) indique que les petites variations de la moyenne sont insignifiantes par rapport aux fluctuations naturelles.
L'auteur soutient que les outils d'économie de tokens devraient être évalués sur le coût par tâche vérifiée et complétée, en tenant compte de la variance des exécutions répétées, de la latence et des métriques de qualité.