一位移动应用开发者通过解决两个主要低效问题,将LLM API成本从初始预估的四倍降至约四分之一:天真地全量重发历史以及冗余的RAG上下文注入。

  • 天真的对话历史重发导致O(n²)令牌增长,因为每一轮都发送完整的前序消息列表,而移动应用从本地缓存重建状态的情况加剧了这一问题。
  • RAG上下文无论主题是否稳定,都在每一轮重新获取并注入,导致为相同的知识库块重复付费。
  • 提示词缓存将系统提示和RAG上下文结构化为稳定前缀,使缓存部分的输入定价降低90%。
  • 超出设定窗口的对话历史由较小模型进行摘要,以防止成本呈二次方增长,同时保持线程连续性。
  • 轻量级分类器检测主题切换以控制RAG检索,防止在连续对话期间重复获取块。
  • 模型路由将简单轮次导向更便宜的模型,同时将大型模型保留用于复杂推理任务。

这些适应措施解决了移动应用生命周期的特定约束,如后台处理和状态重建,而标准服务器端优化指南通常忽略了这些方面。