Together AI는 엔드포인트, 배포 및 불변 구성을 용량 기반 트래픽 분할로 연결하는 전용 모델 추론 플랫폼의 아키텍처를 상세히 설명합니다. 이 시스템은 고정된 비율 대신 유효 용량(가중치에 준비된 복제본 수를 곱한 값)에 따라 요청을 라우팅하여 다운타임 없는 롤아웃과 A/B 테스트와 같은 기능을 가능하게 합니다.
- 구성은 엔진, GPU 유형 및 최적화 프로필(지연 시간, 처리량 또는 균형)을 지정하며, 동작의 일탈을 방지하기 위해 불변입니다.
- 배포는 특정 모델 리비전을 구성에 바인딩하고 복제본에 대한 자동 확장 정책을 관리합니다.
- 엔드포인트는 클라이언트를 위한 안정적인 식별자를 제공하며, 트래픽 분할을 사용하여 부하를 용량에 비례하여 배포 간에 분산합니다.
- 플랫폼은 기본 라우팅 로직과 조합되는 A/B 코호트와 카나리 롤아웃을 지원합니다.
이 기사는 이 모델이 확장 중 포화 문제를 어떻게 방지하는지 보여주고, 프로덕션 중단 피를 위해 다양한 동시성 수준에서 지연 시간 대 처리량과 같은 테스트 프로필의 중요성을 강조합니다.