Together AI 宣布 Together GPU Clusters on Kubernetes 的预emptible计算公开预览,为可容忍中断的工作负载提供更低成本的选项。预emptible节点利用未使用的 NVIDIA accelerated 容量,并按按需费率的固定50%计费。
- 当其他地方需要容量时,节点会被回收,触发五分钟排空序列,期间 pods 接收 SIGTERM 以进行检查点保存并退出。
- 计费按小时以下粒度进行,使用量每1到2分钟计量一次。
- 预emptible节点通过标签 (label) 加入现有集群,允许关键组件保留在标准节点上。
- 该功能支持短期实验、消融实验和临时推理突发,这些任务可以从检查点恢复或在中断后重试。
这使得团队能够利用空闲容量处理非关键工作负载(如批量作业和配置扫描),同时让用户可见的副本保持在有保障的标准基础设施上。