Together AIは、Kubernetes上のTogether GPU Clusters向けにプリエンプティブルコンピューティングのパブリックプレビューを発表し、中断許容ワークロードに対して低コストのオプションを提供します。プリエンプティブルノードは未使用のNVIDIA accelerated容量を利用し、オンデマンド料金の固定50%で請求されます。
- 容量が他の場所で必要になった際にノードを回収でき、5分間のdrainシーケンスがトリガーされ、podsはSIGTERMを受け取ってチェックポイントを作成して終了します。
- 課金は時間未満の粒度で行われ、使用量は1〜2分ごとに計測されます。
- プリエンプティブルノードはラベル(label)を介して既存のクラスターに参加し、重要なコンポーネントが標準ノードに残ることを可能にします。
- この機能は、チェックポイントから再開または中断後に再試行できる短期実験、アブレーション、一時的な推論バーストをサポートします。
これにより、チームはバッチジョブや設定スweepなどの非クリティカルなワークロードに遊休容量を活用しつつ、ユーザー向けレプリカを保証された標準インフラストラクチャ上に維持できます。