Together AI подробно описывает архитектуру своей платформы Dedicated Model Inference, которая связывает конечные точки, развертывания и неизменяемые конфигурации через распределение трафика с учётом пропускной способности. Эта система маршрутизирует запросы на основе эффективной пропускной способности (вес, умноженный на количество готовых реплик), а не фиксированных процентов, что позволяет реализовать функции безостановочного обновления и A/B-тестирования.

  • Конфигурации указывают движок, тип GPU и профили оптимизации (задержка, пропускная способность или сбалансированный) и являются неизменяемыми для предотвращения дрейфа поведения.
  • Развертывания привязывают конкретную ревизию модели к конфигурации и управляют политиками автоскейлинга для реплик.
  • Конечные точки предоставляют стабильный идентификатор для клиентов, используя распределение трафика для пропорционального распределения нагрузки между развертываниями в зависимости от их пропускной способности.
  • Платформа поддерживает A/B-когорты и канареечные обновления, которые интегрируются с базовой логикой маршрутизации.

В статье показано, как эта модель предотвращает проблемы насыщения при масштабировании и подчеркивается важность тестирования профилей, таких как задержка по сравнению с пропускной способностью, на различных уровнях параллелизма, чтобы избежать простоев в продакшене.