A NVIDIA demonstrou o serviço do modelo de parâmetros Qwen 3.8 2.4T com capacidades de raciocínio configuráveis em sua plataforma de hardware GB300 NVL72.

  • O sistema alcança uma taxa de transferência de mais de 4.000 tokens por segundo por GPU usando precisão FP8 sem ajuste adicional do modelo.
  • Cada usuário recebe aproximadamente 350 tokens por segundo na configuração de 72 GPUs.
  • Ganhos adicionais de desempenho são esperados através de otimizações como a precisão NVFP4.

Esta implantação destaca a capacidade do GB300 NVL72 de lidar com modelos massivos com alta taxa de transferência e baixa latência para usuários finais.