Tim kernel di Together AI telah mengoptimalkan pustaka ThunderKittens untuk memanfaatkan fitur baru di platform NVIDIA Vera Rubin NVL72, khususnya menargetkan peningkatan kinerja untuk perkalian matriks NVFP4 dan FP8.

  • Inti tensor Vera Rubin mengonsumsi operand dua kali lebih cepat dengan langkah K 64 byte dibandingkan 32 byte pada Blackwell.
  • Memori tensor meningkat menjadi 576 kolom, menyediakan tambahan 32 KiB yang dapat diakses melalui kualifier .exclusive.
  • Memori bersama dapat diperluas secara dinamis hingga 328 KiB, dan penyangga pengumpul sisi-B memungkinkan penggunaan ulang operand.
  • Instruksi tcgen05.commit.sync_restrict memungkinkan pelepasan awal ubin A untuk memisahkan beban dari komputasi.
  • Mengintegrasikan fitur ini mendorong kinerja NVFP4 melampaui 22 PFLOPS, mencapai kesetaraan dengan cuBLAS dan CuTE DSL.

Optimasi ini mengatasi hambatan di mana inti tensor mengonsumsi data lebih cepat daripada yang dapat disediakan oleh kernel Blackwell sebelumnya, memungkinkan throughput yang kompetitif pada arsitektur baru.