NVIDIA ha demostrado servir el modelo de parámetros Qwen 3.8 2.4T con capacidades de razonamiento configurables en su plataforma de hardware GB300 NVL72.

  • El sistema logra un rendimiento de más de 4,000 tokens por segundo por GPU utilizando precisión FP8 sin ajuste adicional del modelo.
  • Cada usuario recibe aproximadamente 350 tokens por segundo a través de la configuración de 72 GPUs.
  • Se esperan mayores ganancias de rendimiento mediante optimizaciones como la precisión NVFP4.

Este despliegue destaca la capacidad del GB300 NVL72 para manejar modelos masivos con alto rendimiento y baja latencia para los usuarios finales.