NVIDIA a démontré le service du modèle de paramètres Qwen 3.8 2.4T avec des capacités de raisonnement configurables sur sa plateforme matérielle GB300 NVL72.

  • Le système atteint un débit de plus de 4 000 tokens par seconde par GPU en utilisant la précision FP8 sans ajustement supplémentaire du modèle.
  • Chaque utilisateur reçoit environ 350 tokens par seconde sur la configuration à 72 GPUs.
  • Des gains de performance supplémentaires sont attendus grâce à des optimisations telles que la précision NVFP4.

Ce déploiement met en évidence la capacité du GB300 NVL72 à gérer des modèles massifs avec un débit élevé et une faible latence pour les utilisateurs finaux.