Together AI 详细介绍了其专用模型推理平台的架构,该平台通过基于容量感知的流量分割将端点、部署和不可变配置连接起来。该系统根据有效容量(权重乘以就绪副本数)而非固定百分比来路由请求,从而支持零停机发布和 A/B 测试等功能。

  • 配置指定引擎、GPU 类型和优化配置文件(延迟、吞吐量或平衡),并且是不可变的,以防止行为漂移。
  • 部署将特定模型版本绑定到配置,并管理副本的自动扩缩容策略。
  • 端点为客户端提供稳定的身份标识,使用流量分割按容量比例将负载分配到各个部署。
  • 该平台支持 A/B 测试组和金丝雀发布,这些功能可与基础路由逻辑组合使用。

文章展示了该模型如何防止扩展期间的饱和问题,并强调了在不同并发级别下测试延迟与吞吐量等配置文件的重要性,以避免生产环境停滞。