Um desenvolvedor de aplicativos móveis reduziu os custos da API de LLM de quatro vezes a estimativa inicial para cerca de um quarto desse valor ao abordar duas ineficiências principais: o reenvio ingênuo do histórico completo e a injeção redundante de contexto RAG.

  • O reenvio ingênuo do histórico de conversas causou crescimento de tokens O(n²) porque cada turno enviava a lista completa de mensagens anteriores, o que é exacerbado por aplicativos móveis que reconstruem o estado a partir de caches locais.
  • O contexto RAG era novamente buscado e injetado em cada turno, independentemente da estabilidade do tópico, levando ao pagamento repetido por blocos idênticos da base de conhecimento.
  • O cache de prompts estruturou o prompt do sistema e o contexto RAG como um prefixo estável, alcançando uma redução de 90% no preço de entrada para as partes em cache.
  • O histórico de conversas além de uma janela definida é resumido por um modelo menor para evitar o crescimento quadrático dos custos enquanto mantém a continuidade da thread.
  • Um classificador leve detecta mudanças de tópico para controlar a recuperação RAG, impedindo a busca redundante de blocos durante conversas contínuas.
  • O roteamento de modelos direciona turnos simples para modelos mais baratos enquanto reserva modelos maiores para tarefas de raciocínio complexo.

Essas adaptações abordam as restrições específicas dos ciclos de vida de aplicativos móveis, como o envio em segundo plano e a reconstrução de estado, que muitas vezes são negligenciados pelos guias padrão de otimização do lado do servidor.