Together AI mengumumkan pratinjau publik komputasi preemptible untuk Kluster GPU Together di Kubernetes, menawarkan opsi biaya lebih rendah untuk beban kerja yang toleran terhadap interupsi. Node preemptible memanfaatkan kapasitas akselerasi NVIDIA yang tidak terpakai dan ditagih sebesar 50% tetap dari tarif on-demand.

  • Node dapat diambil kembali ketika kapasitas dibutuhkan di tempat lain, memicu urutan drain selama lima menit di mana pods menerima SIGTERM untuk membuat checkpoint dan keluar.
  • Penagihan dilakukan per bagian jam, dengan penggunaan diukur setiap satu hingga dua menit.
  • Node preemptible bergabung dengan kluster yang ada melalui label, memungkinkan komponen kritis tetap berada pada node standar.
  • Fitur ini mendukung eksperimen singkat, ablasi, dan lonjakan inferensi sementara yang dapat dilanjutkan dari checkpoint atau dicoba ulang setelah interupsi.

Hal ini memungkinkan tim memanfaatkan kapasitas menganggur untuk beban kerja non-kritis seperti job batch dan sweep konfigurasi sambil menjaga replika yang berhadapan dengan pengguna tetap pada infrastruktur standar terjamin.