对使用 GPT-5.6-sol 和 Codex CLI 0.144.1 进行的编码智能体任务的分析表明,将上下文 token 减少 90% 并不会带来与完整任务成比例的成本节约。
- 比较无插件、Ponytail 和隔离 RTK 插件的代码库重写基准测试显示,尽管 token 数量存在差异,但成本差异极小。
- 与基线相比,Ponytail 的 token 减少了 7.56%,成本降低了 8.87%,但所需时间延长了 13.51%。
- 与基线相比,RTK 导致 token 增加了 13.20%,成本增加了 7.18%,且轮次多了 44%。
- 缓存输入占 token 的 96.46% 和成本的 63.91%,而模型输出仅占 token 的 0.38%。
- 运行间的高方差(30-51%)表明,微小的均值变化与自然波动相比并不显著。
作者认为,应基于每次验证完成的任务成本、重复运行的方差、延迟和质量指标来评估节省 token 的工具。