GPT-5.6-sol 및 Codex CLI 0.144.1을 사용한 코딩 에이전트 작업 분석은 컨텍스트 토큰을 90% 줄이는 것이 전체 작업에 대한 비례 비용 절감으로 이어지지 않음을 보여줍니다.
- 플러그인 없음, Ponytail 및 격리된 RTK 플러그인을 비교한 저장소 리라이팅 벤치마크는 토큰 변동에도 불구하고 최소한의 비용 차이만을 보였습니다.
- Ponytail은 기준선 대비 7.56% 적은 토큰과 8.87% 낮은 비용을 달성했지만, 기준선보다 13.51% 더 긴 실행 시간을 요구했습니다.
- RTK는 기준선 대비 13.20% 더 많은 토큰과 7.18% 높은 비용, 그리고 44% 더 많은 라운드를 발생시켰습니다.
- 캐시된 입력은 토큰의 96.46%와 비용의 63.91%를 차지한 반면, 모델 출력은 토큰의 단 0.38%에 불과했습니다.
- 높은 실행 간 변동성(30-51%)은 작은 평균 변화가 자연스러운 변동에 비해 무의미함을 나타냅니다.
저자는 토큰 절감 도구가 반복 실행 변동성, 지연 시간 및 품질 지표를 포함한 검증된 완료 작업당 비용으로 평가되어야 한다고 주장합니다.