Un développeur d'applications mobiles a réduit les coûts des API LLM, qui étaient quatre fois supérieurs à l'estimation initiale, à environ un quart de ce montant en traitant deux inefficacités principales : la renvoi naïf de l'historique complet et l'injection redondante du contexte RAG.
- Le renvoi naïf de l'historique de conversation entraînait une croissance des tokens en O(n²) car chaque tour envoyait la liste complète des messages précédents, ce qui est exacerbé par les applications mobiles reconstruisant l'état à partir de caches locaux.
- Le contexte RAG était re-fetché et injecté à chaque tour, indépendamment de la stabilité du sujet, entraînant un paiement répété pour des chunks identiques de la base de connaissances.
- La mise en cache des prompts a structuré le prompt système et le contexte RAG comme un préfixe stable, atteignant une réduction de 90 % du prix d'entrée pour les portions mises en cache.
- L'historique de conversation au-delà d'une fenêtre définie est résumé par un modèle plus petit afin d'éviter une croissance quadratique des coûts tout en maintenant la continuité du fil de discussion.
- Un classifieur léger détecte les changements de sujet pour contrôler le retrieval RAG, empêchant la récupération redondante de chunks lors de conversations continues.
- Le routage des modèles dirige les tours simples vers des modèles moins chers tout en réservant les modèles plus grands aux tâches de raisonnement complexes.
Ces adaptations répondent aux contraintes spécifiques des cycles de vie des applications mobiles, telles que la mise en arrière-plan et la reconstruction d'état, que les guides d'optimisation côté serveur standard négligent souvent.