NVIDIA продемонстрировала развертывание модели Qwen 3.8 2.4T с параметрами и настраиваемыми возможностями рассуждения на аппаратной платформе GB300 NVL72.

  • Система достигает пропускной способности более 4 000 токенов в секунду на GPU с использованием точности FP8 без дополнительной настройки модели.
  • Каждый пользователь получает примерно 350 токенов в секунду в конфигурации из 72 GPU.
  • Ожидается дальнейшее повышение производительности за счет оптимизаций, таких как точность NVFP4.

Эта развертка подчеркивает способность GB300 NVL72 обрабатывать огромные модели с высокой пропускной способностью и низкой задержкой для конечных пользователей.