Together AI анонсировала публичную предварительную версию прерываемых вычислений для Together GPU Clusters на Kubernetes, предлагая более дешёвый вариант для нагрузок, устойчивых к прерываниям. Прерываемые узлы используют неиспользуемые мощности NVIDIA accelerated и тарифицируются по фиксированной ставке 50% от цены on-demand.
- Узлы могут быть отозваны, когда мощность требуется в другом месте, что запускает пятиминутную последовательность drain, во время которой поды получают SIGTERM для создания контрольных точек и завершения работы.
- Биллинг происходит с точностью до части часа, учёт использования осуществляется каждые одну-две минуты.
- Прерываемые узлы присоединяются к существующим кластерам через метку (label), что позволяет критическим компонентам оставаться на стандартных узлах.
- Функция поддерживает короткие эксперименты, абляции и временные всплески инференса, которые могут возобновляться из контрольных точек или повторяться после прерывания.
Это позволяет командам использовать свободные мощности для некритичных нагрузок, таких как пакетные задания и обходы конфигураций, сохраняя пользовательские реплики на гарантированной стандартной инфраструктуре.