Команда разработчиков ядер Together AI оптимизировала библиотеку ThunderKittens для использования новых функций платформы NVIDIA Vera Rubin NVL72, с особым акцентом на повышение производительности матричных умножений в форматах NVFP4 и FP8.
- Ядра тензоров Vera Rubin потребляют операнды вдвое быстрее при шаге K 64 байта по сравнению с 32 байтами у Blackwell.
- Объём тензорной памяти увеличен до 576 столбцов, что предоставляет дополнительные 32 КиБ, доступные через квалификатор .exclusive.
- Общая память динамически расширяется до 328 КиБ, а буфер сбора для стороны B позволяет повторно использовать операнды.
- Инструкция tcgen05.commit.sync_restrict обеспечивает раннее освобождение тайлов A, чтобы разделить загрузку данных и вычисления.
- Интеграция этих функций повышает производительность NVFP4 более чем до 22 PFLOPS, достигая уровня соответствия cuBLAS и CuTE DSL.
Эти оптимизации устраняют узкое место, при котором тензорные ядра потребляют данные быстрее, чем предыдущие ядра Blackwell могли их поставлять, обеспечивая конкурентоспособную пропускную способность на новой архитектуре.