Together AI annonce la prévisualisation publique du calcul preemptible pour Together GPU Clusters sur Kubernetes, offrant une option moins coûteuse pour les charges de travail tolérantes aux interruptions. Les nœuds preemptibles utilisent la capacité accélérée NVIDIA inutilisée et sont facturés à 50 % fixes du tarif on-demand.

  • Les nœuds peuvent être récupérés lorsque la capacité est nécessaire ailleurs, déclenchant une séquence de drain de cinq minutes où les pods reçoivent SIGTERM pour faire des points de contrôle et quitter.
  • La facturation est sous-horaire, avec l'utilisation mesurée toutes les une à deux minutes.
  • Les nœuds preemptibles rejoignent les clusters existants via le label (étiquette), permettant aux composants critiques de rester sur des nœuds standard.
  • La fonctionnalité prend en charge les expériences courtes, les ablations et les pics d'inférence temporaires qui peuvent reprendre à partir de points de contrôle ou être réessayés après une interruption.

Cela permet aux équipes d'exploiter la capacité inutilisée pour des charges de travail non critiques comme les jobs par lots et les balayages de configuration, tout en maintenant les réplicas visibles par l'utilisateur sur une infrastructure standard garantie.