GPT-5.6-sol और Codex CLI 0.144.1 का उपयोग करके कोडिंग एजेंट कार्यों का विश्लेषण दर्शाता है कि संदर्भ टोकन को 90% कम करने से पूरे कार्य के लिए समानुपातिक लागत बचत नहीं होती।
- कोई प्लगइन, Ponytail और अलग RTK प्लगइनों की तुलना करने वाले रिपॉजिटरी रीराइट बेंचमार्क में टोकन भिन्नता के बावजूद न्यूनतम लागत अंतर दिखा।
- Ponytail ने आधार रेखा की तुलना में 7.56% कम टोकन और 8.87% कम लागत हासिल की, लेकिन इसे 13.51% अधिक अवधि की आवश्यकता हुई।
- RTK ने आधार रेखा की तुलना में 13.20% अधिक टोकन, 7.18% अधिक लागत और 44% अधिक राउंड उत्पन्न किए।
- कैशेड इनपुट ने 96.46% टोकन और 63.91% लागत का हिस्सा लिया, जबकि मॉडल आउटपुट केवल 0.38% टोकन था।
- उच्च रन-टू-रन भिन्नता (30-51%) यह संकेत देती है कि प्राकृतिक उतार-चढ़ाव की तुलना में छोटे माध्य परिवर्तन नगण्य हैं।
लेखक का तर्क है कि टोकन-बचत उपकरणों का मूल्यांकन पुनरावृत्ति-रन भिन्नता, लेटेंसी और गुणवत्ता मापदंडों सहित प्रमाणित पूर्ण कार्य प्रति लागत पर किया जाना चाहिए।