あるモバイルアプリ開発者は、2つの主要な非効率性——愚直な全履歴の再送信と冗長なRAGコンテキストの注入——に対処することで、LLM APIのコストを当初の見積もりの4倍からその約4分の1に削減しました。

  • 愚直な会話履歴の再送信は、各ターンで以前のメッセージリスト全体を送信するためO(n²)のトークン増加を引き起こし、モバイルアプリがローカルキャッシュから状態を再構築することでさらに悪化します。
  • RAGコンテキストはトピックの安定性に関係なく各ターンで再フェッチされ注入されるため、同一の知識ベースチャンクに対して繰り返し課金されていました。
  • プロンプトキャッシングはシステムプロンプトとRAGコンテキストを安定したプレフィックスとして構造化し、キャッシュされた部分の入力価格を90%削減しました。
  • 設定されたウィンドウを超える会話履歴は、スレッドの連続性を維持しつつ二次的なコスト増加を防ぐために、より小さなモデルによって要約されます。
  • 軽量な分類器がトピックのシフトを検出し、RAG検索をゲート制御することで、継続的な会話中に冗長なチャンクフェッチを防ぎます。
  • モデルルーティングは単純なターンを低コストのモデルに振り分け、複雑な推論タスクには大規模なモデルを確保します。

これらの適応策は、標準的なサーバーサイド最適化ガイドがしばしば見落としがちな、バックグラウンド移行や状態再構築といったモバイルアプリライフサイクルの特定の制約に対処しています。