对使用 GPT-5.6-sol 和 Codex CLI 0.144.1 进行的编码智能体任务的分析表明,将上下文 token 减少 90% 并不会带来与完整任务成比例的成本节约。

  • 比较无插件、Ponytail 和隔离 RTK 插件的代码库重写基准测试显示,尽管 token 数量存在差异,但成本差异极小。
  • 与基线相比,Ponytail 的 token 减少了 7.56%,成本降低了 8.87%,但所需时间延长了 13.51%。
  • 与基线相比,RTK 导致 token 增加了 13.20%,成本增加了 7.18%,且轮次多了 44%。
  • 缓存输入占 token 的 96.46% 和成本的 63.91%,而模型输出仅占 token 的 0.38%。
  • 运行间的高方差(30-51%)表明,微小的均值变化与自然波动相比并不显著。

作者认为,应基于每次验证完成的任务成本、重复运行的方差、延迟和质量指标来评估节省 token 的工具。