NVIDIA telah mendemonstrasikan layanan model parameter Qwen 3.8 2.4T dengan kemampuan penalaran yang dapat dikonfigurasi pada platform perangkat keras GB300 NVL72-nya.
- Sistem mencapai throughput lebih dari 4.000 token per detik per GPU menggunakan presisi FP8 tanpa penyetelan model tambahan.
- Setiap pengguna menerima sekitar 350 token per detik di konfigurasi 72-GPU.
- Peningkatan kinerja lebih lanjut diharapkan melalui optimasi seperti presisi NVFP4.
Penyebaran ini menyoroti kapasitas GB300 NVL72 untuk menangani model besar dengan throughput tinggi dan latensi rendah bagi pengguna akhir.