Analisis tugas agen pemrograman menggunakan GPT-5.6-sol dan Codex CLI 0.144.1 menunjukkan bahwa mengurangi konteks token sebesar 90% tidak menghasilkan penghematan biaya yang proporsional untuk keseluruhan tugas.

  • Benchmark penulisan ulang repositori yang membandingkan tanpa plugin, Ponytail, dan plugin RTK terisolasi menunjukkan perbedaan biaya yang minimal meskipun terdapat variasi token.
  • Ponytail mencapai 7.56% token lebih sedikit dan biaya 8.87% lebih rendah tetapi memerlukan durasi 13.51% lebih lama dibandingkan dengan baseline.
  • RTK menghasilkan 13.20% token lebih banyak dan biaya 7.18% lebih tinggi dengan 44% putaran lebih banyak daripada baseline.
  • Input yang di-cache menyumbang 96.46% dari token dan 63.91% dari biaya, sementara output model hanya 0.38% dari token.
  • Variansi tinggi antar-jalankan (30-51%) menunjukkan bahwa perubahan rata-rata kecil tidak signifikan dibandingkan dengan fluktuasi alami.

Penulis berargumen bahwa alat penghemat token harus dievaluasi berdasarkan biaya per tugas yang selesai terverifikasi, termasuk variansi antar-jalankan berulang, latensi, dan metrik kualitas.