NVIDIA展示了在其GB300 NVL72硬件平台上提供具有可配置推理能力的Qwen 3.8 2.4T参数模型。
- 该系统在不进行额外模型调整的情况下,使用FP8精度实现了每GPU超过4,000 tok/s的吞吐量。
- 在72 GPU配置中,每个用户每秒获得约350个token。
- 预计通过NVFP4精度等优化措施将进一步获得性能提升。
此次部署突显了GB300 NVL72处理大规模模型的能力,同时为终端用户提供高吞吐量和低延迟。
NVIDIA展示了在其GB300 NVL72硬件平台上提供具有可配置推理能力的Qwen 3.8 2.4T参数模型。
此次部署突显了GB300 NVL72处理大规模模型的能力,同时为终端用户提供高吞吐量和低延迟。