Together AI는 Kubernetes에서 Together GPU Clusters를 위한 프리엠프터블 컴퓨팅의 공개 미리보기를 발표하며, 중단 허용 워크로드에 대해 더 낮은 비용 옵션을 제공합니다. 프리엠프터블 노드는 미사용 NVIDIA accelerated 용량을 활용하며 온디맨드 요금의 고정 50%로 청구됩니다.

  • 용량이 다른 곳에서 필요할 때 노드를 회수할 수 있으며, 이때 5분간의 drain 시퀀스가 트리거되어 pods가 SIGTERM을 받아 체크포인트를 생성하고 종료합니다.
  • 과금은 시간 미만 단위로 이루어지며, 사용량은 1~2분마다 측정됩니다.
  • 프리엠프터블 노드는 label을 통해 기존 클러스터에 합류하여 중요한 구성 요소가 표준 노드에 남아있도록 합니다.
  • 이 기능은 체크포인트에서 재개하거나 중단 후 재시도할 수 있는 짧은 실험, 아블레이션, 임시 추론 버스트를 지원합니다.

이를 통해 팀은 배치 작업 및 구성 스윕과 같은 비중요 워크로드에 여유 용량을 활용하면서 사용자-facing 복제본은 보장된 표준 인프라에 유지할 수 있습니다.