Команда разработчиков ядер Together AI оптимизировала библиотеку ThunderKittens для использования новых функций платформы NVIDIA Vera Rubin NVL72, с особым акцентом на повышение производительности матричных умножений в форматах NVFP4 и FP8.

  • Ядра тензоров Vera Rubin потребляют операнды вдвое быстрее при шаге K 64 байта по сравнению с 32 байтами у Blackwell.
  • Объём тензорной памяти увеличен до 576 столбцов, что предоставляет дополнительные 32 КиБ, доступные через квалификатор .exclusive.
  • Общая память динамически расширяется до 328 КиБ, а буфер сбора для стороны B позволяет повторно использовать операнды.
  • Инструкция tcgen05.commit.sync_restrict обеспечивает раннее освобождение тайлов A, чтобы разделить загрузку данных и вычисления.
  • Интеграция этих функций повышает производительность NVFP4 более чем до 22 PFLOPS, достигая уровня соответствия cuBLAS и CuTE DSL.

Эти оптимизации устраняют узкое место, при котором тензорные ядра потребляют данные быстрее, чем предыдущие ядра Blackwell могли их поставлять, обеспечивая конкурентоспособную пропускную способность на новой архитектуре.