एक मोबाइल ऐप डेवलपर ने दो प्राथमिक अक्षमताओं को दूर करके LLM API लागत को प्रारंभिक अनुमान से चार गुना से घटाकर लगभग उसका चौथाई कर दिया: नॉइव फुल-हिस्टरी रिसेंडिंग और रिडंडेंट RAG कॉन्टेक्स्ट इंजेक्शन।
- नॉइव कन्वर्सेशन हिस्टरी रिसेंडिंग ने O(n²) टोकन ग्रोथ का कारण बना क्योंकि हर टर्न पर पूर्ण प्रायः मैसेज लिस्ट भेजी जाती थी, जो मोबाइल ऐप्स द्वारा लोकल कैश से स्टेट रिकंस्ट्रक्ट करने के कारण और भी बढ़ जाता है।
- RAG कॉन्टेक्स्ट को टॉपिक स्थिरता की परवाह किए बिना हर टर्न पर फिर से फेच किया जाता था और इंजेक्ट किया जाता था, जिसके परिणामस्वरूप समान ज्ञान-बेस चंक्स के लिए बार-बार भुगतान करना पड़ता था।
- प्रॉम्प्ट कैशिंग ने सिस्टम प्रॉम्प्ट और RAG कॉन्टेक्स्ट को एक स्थिर प्रीफिक्स के रूप में संरचित किया, जिससे कैश किए गए हिस्सों के लिए इनपुट प्राइसिंग में 90% की कमी आई।
- निर्धारित विंडो से परे कन्वर्सेशन हिस्टरी को थ्रेड निरंतरता बनाए रखते हुए चतुर्भुजाकार लागत वृद्धि को रोकने के लिए एक छोटा मॉडल सारांशित करता है।
- एक लाइटवेट क्लासिफायर टॉपिक शिफ्ट का पता लगाकर RAG रिट्रीवल को गेट करता है, जिससे निरंतर कन्वर्सेशन के दौरान रिडंडेंट चंक-फेचिंग से बचा जाता है।
- मॉडल रूटिंग सरल टर्न को सस्ते मॉडल्स की ओर निर्देशित करती है जबकि जटिल तर्क कार्यों के लिए बड़े मॉडल्स को सुरक्षित रखती है।
ये अनुकूलन मोबाइल ऐप लाइफसाइकल की विशिष्ट बाधाओं, जैसे बैकग्राउंडिंग और स्टेट रिकंस्ट्रक्शन को संबोधित करते हैं, जिन्हें मानक सर्वर-साइड ऑप्टिमाइजेशन गाइड अक्सर नजरअंदाज कर देते हैं।