NVIDIA는 구성 가능한 추론 기능을 갖춘 Qwen 3.8 2.4T 파라미터 모델을 자체 GB300 NVL72 하드웨어 플랫폼에서 서빙하는 것을 시연했습니다.

  • 시스템은 추가 모델 튜닝 없이 FP8 정밀도를 사용하여 GPU당 초당 4,000개 이상의 토큰 처리량을 달성합니다.
  • 각 사용자는 72-GPU 구성을 통해 초당 약 350개의 토큰을 받습니다.
  • NVFP4 정밀도 등의 최적화를 통해 추가 성능 향상이 예상됩니다.

이 배포는 최종 사용자를 위해 높은 처리량과 낮은 지연 시간으로 거대한 모델을 처리할 수 있는 GB300 NVL72의 능력을 강조합니다.