Together AI 已在其专用模型推理平台中添加了自动扩缩容功能,允许部署根据推理引擎可理解的指标(如进行中请求、首字延迟(TTFT)和 GPU 利用率)进行扩缩容。

  • 该系统使用具有可配置副本边界和时间窗口的比例控制回路来管理扩缩容。
  • 用户可从八种指标中选择,分为并发驱动型(例如 inflight_requests)、SLO 驱动型(例如 ttft)或效率驱动型(例如 gpu_utilization)。
  • 推荐将并发驱动型指标作为默认选项,因为它们在延迟恶化前可作为负载的领先指标。
  • 该平台不支持自动缩容至零;将最小和最大副本数显式设置为 0 会停止部署。
  • 对 Qwen3.5-9B 模型进行的实验表明,在流量激增期间,只有 inflight_requests 指标成功实现了扩缩容,而 TTFT 和 GPU 利用率策略未能做出响应。

自动扩缩容通过防止空闲 GPU 的过度配置以及峰值流量期间因配置不足导致的严重延迟恶化,帮助平衡成本与性能。