Un desarrollador de aplicaciones móviles redujo los costos de la API de LLM de cuatro veces la estimación inicial a aproximadamente una cuarta parte de esa cantidad al abordar dos ineficiencias principales: el reenvío ingenuo del historial completo y la inyección redundante de contexto RAG.

  • El reenvío ingenuo del historial de conversación causó un crecimiento de tokens O(n²) porque cada turno enviaba la lista completa de mensajes previos, lo cual se ve exacerbado por las aplicaciones móviles que reconstruyen el estado desde cachés locales.
  • El contexto RAG se volvía a buscar e inyectaba en cada turno independientemente de la estabilidad del tema, lo que llevaba a pagar repetidamente por fragmentos idénticos de la base de conocimientos.
  • El almacenamiento en caché de prompts estructuró el prompt del sistema y el contexto RAG como un prefijo estable, logrando una reducción del 90% en el precio de entrada para las porciones almacenadas en caché.
  • El historial de conversación más allá de una ventana establecida se resume mediante un modelo más pequeño para evitar el crecimiento cuadrático de los costos mientras se mantiene la continuidad del hilo.
  • Un clasificador ligero detecta cambios de tema para gestionar la recuperación RAG, evitando la búsqueda redundante de fragmentos durante conversaciones continuas.
  • El enrutamiento de modelos dirige los turnos simples a modelos más económicos mientras reserva los modelos más grandes para tareas de razonamiento complejo.

Estas adaptaciones abordan las restricciones específicas de los ciclos de vida de las aplicaciones móviles, como la suspensión en segundo plano y la reconstrucción del estado, que las guías estándar de optimización del lado del servidor suelen pasar por alto.