Seorang pengembang aplikasi seluler mengurangi biaya API LLM dari empat kali estimasi awal menjadi sekitar seperempat jumlah tersebut dengan mengatasi dua ketidakefisienan utama: pengiriman ulang riwayat lengkap yang naif dan injeksi konteks RAG yang redundan.

  • Pengiriman ulang riwayat percakapan secara naif menyebabkan pertumbuhan token O(n²) karena setiap giliran mengirimkan daftar pesan sebelumnya secara penuh, yang diperparah oleh aplikasi seluler yang membangun ulang keadaan dari cache lokal.
  • Konteks RAG diambil ulang dan diinjeksikan pada setiap giliran terlepas dari stabilitas topik, mengakibatkan pembayaran berulang untuk potongan basis pengetahuan yang identik.
  • Caching prompt menyusun prompt sistem dan konteks RAG sebagai awalan stabil, mencapai pengurangan 90% dalam harga input untuk bagian yang di-cache.
  • Riwayat percakapan di luar jendela tertentu diringkas oleh model yang lebih kecil untuk mencegah pertumbuhan biaya kuadratik sambil mempertahankan kesinambungan utas.
  • Klasifikasi ringan mendeteksi pergeseran topik untuk mengontrol pengambilan RAG, mencegah pengambilan potongan redundan selama percakapan berkelanjutan.
  • Pengalihan model mengarahkan giliran sederhana ke model yang lebih murah sambil menyimpan model besar untuk tugas penalaran kompleks.

Adaptasi ini mengatasi batasan spesifik siklus hidup aplikasi seluler, seperti pengaktifan latar belakang dan pembangunan ulang keadaan, yang sering diabaikan oleh panduan optimasi sisi server standar.