A Together AI anuncia a pré-visualização pública do computo preemptível para os Clusters de GPU da Together no Kubernetes, oferecendo uma opção de menor custo para cargas de trabalho tolerantes a interrupções. Os nós preemptíveis utilizam capacidade acelerada NVIDIA não utilizada e são cobrados a 50% fixo da taxa sob demanda.

  • Os nós podem ser recuperados quando a capacidade é necessária em outro lugar, acionando uma sequência de drenagem de cinco minutos onde os pods recebem SIGTERM para fazer checkpoints e sair.
  • A cobrança é por fração de hora, com o uso medido a cada um ou dois minutos.
  • Os nós preemptíveis se juntam aos clusters existentes via label (etiqueta), permitindo que componentes críticos permaneçam em nós padrão.
  • O recurso suporta experimentos curtos, ablações e picos temporários de inferência que podem retomar a partir de checkpoints ou tentar novamente após uma interrupção.

Isso permite que as equipes aproveitem a capacidade ociosa para cargas de trabalho não críticas, como jobs em lote e varreduras de configuração, mantendo réplicas voltadas ao usuário em infraestrutura padrão garantida.