NVIDIAは、構成可能な推論機能を持つQwen 3.8 2.4Tパラメータモデルを、そのGB300 NVL72ハードウェアプラットフォーム上で提供することをデモンストレーションしました。
- システムは、追加のモデル調整なしでFP8精度を使用して、GPUあたり毎秒4,000トークンを超えるスループットを実現します。
- 各ユーザーは、72 GPU構成全体で毎秒約350トークンを受け取ります。
- NVFP4精度などの最適化を通じて、さらなるパフォーマンスの向上が期待されます。
このデプロイメントは、エンドユーザー向けに高いスループットと低レイテンシを備えた巨大なモデルを処理するGB300 NVL72の能力を強調しています。