모바일 앱 개발자가 두 가지 주요 비효율성, 즉 무분별한 전체 히스토리 재전송과 중복 RAG 컨텍스트 주입을 해결함으로써 LLM API 비용을 초기 추정치의 네 배에서 약 사분의 일로 낮췄습니다.
- 무분별한 대화 히스토리 재전송은 매 턴마다 이전 메시지 목록 전체를 전송하므로 O(n²) 토큰 증가를 초래하며, 이는 모바일 앱이 로컬 캐시에서 상태를 복원하면서 악화됩니다.
- RAG 컨텍스트는 주제 안정성과 관계없이 모든 턴마다 다시 가져와 주입되어 동일한 지식 베이스 청크에 대해 반복적으로 비용을 지불하게 됩니다.
- 프롬프트 캐싱은 시스템 프롬프트와 RAG 컨텍스트를 안정적인 접두사로 구조화하여, 캐시된 부분의 입력 가격 대비 90% 절감을 달성했습니다.
- 설정된 윈도우를 넘어선 대화 히스토리는 스레드 연속성을 유지하면서 이차적 비용 성장을 방지하기 위해 더 작은 모델로 요약됩니다.
- 경량 분류기는 주제 전환을 감지하여 RAG 검색을 제어하며, 지속적인 대화 중 중복 청크 가져오기를 방지합니다.
- 모델 라우팅은 간단한 턴은 저렴한 모델로 처리하고 복잡한 추론 작업에는 대형 모델을 예약합니다.
이러한 적응책들은 표준 서버 사이드 최적화 가이드가 종종 간과하는 백그라운드 전환 및 상태 복원 등 모바일 앱 수명 주기의 특정 제약 조건을 해결합니다.