NVIDIA продемонстрировала развертывание модели Qwen 3.8 2.4T с параметрами и настраиваемыми возможностями рассуждения на аппаратной платформе GB300 NVL72.
- Система достигает пропускной способности более 4 000 токенов в секунду на GPU с использованием точности FP8 без дополнительной настройки модели.
- Каждый пользователь получает примерно 350 токенов в секунду в конфигурации из 72 GPU.
- Ожидается дальнейшее повышение производительности за счет оптимизаций, таких как точность NVFP4.
Эта развертка подчеркивает способность GB300 NVL72 обрабатывать огромные модели с высокой пропускной способностью и низкой задержкой для конечных пользователей.