Together AI は、エンドポイント、デプロイメント、不変設定を容量認識のトラフィック分割で結びつける Dedicated Model Inference プラットフォームのアーキテクチャについて詳述している。このシステムは、固定パーセンテージではなく有効容量(重み×準備完了レプリカ数)に基づいてリクエストをルーティングし、ゼロダウンタイムでのロールアウトや A/B テストなどの機能を実現する。
- 設定ではエンジン、GPU タイプ、最適化プロファイル(レイテンシ、スループット、またはバランス)を指定し、挙動のドリフトを防ぐために不変とする。
- デプロイメントは特定のモデルリビジョンを設定にバインドし、レプリカ用のオートスケーリングポリシーを管理する。
- エンドポイントはクライアントに対して安定したアイデンティティを提供し、トラフィック分割を通じて容量に比例してデプロイメント間で負荷を分散させる。
- 本プラットフォームは A/B コホートとキャニロールールアウトをサポートしており、これらは基本ルーティングロジックと組み合わせて動作する。
記事では、このモデルがスケーリング時の飽和問題をどのように回避するかを示し、プロダクションの停止を防ぐために、異なる同時実行レベルでレイテンシとスループットのテストプロファイルを検証することの重要性を強調している。