Together AI представила функцию платформы, которая позволяет командам проводить A/B-эксперименты на рабочих конечных точках, разделяя трафик между контрольной группой и до 20 вариантами для оценки производительности кандидатных моделей с реальными пользователями.

  • Эксперименты привязываются к конечной точке, распределяя долю трафика контрольной группы между ветвями, при этом развертывание вариантов должно иметь нулевой вес в базовом распределении.
  • Доли трафика представляют собой фиксированные проценты, независимые от количества реплик, что обеспечивает согласованность измерений независимо от автоскейлинга.
  • Плавное изменение нагрузки осуществляется путем обновления набора участников с защитой etag для предотвращения тихих перезаписей, что позволяет проводить многовариантные тесты с до 20 вариантами.
  • Платформа предоставляет метрики инфраструктуры для каждого развертывания и требует от пользователей объединения метаданных ответов с собственными сигналами качества продукта.
  • Эксперименты можно завершить, продвигая победителя через синее-зеленое развертывание или удаляя эксперимент, чтобы вернуть весь трафик контрольной группе.

Эта функция позволяет командам определять, улучшает ли новая модель удержание пользователей или показатели завершения задач, избегая недостатков ручной логики маршрутизации на стороне клиента, которая может дрейфовать или сохраняться после окончания экспериментов.