Together AIのカーネルチームは、NVIDIA Vera Rubin NVL72プラットフォームの新機能を活用するためにThunderKittensライブラリを最適化し、特にNVFP4およびFP8行列乗算のパフォーマンス向上を対象としています。

  • Vera Rubinテンソルコアは、Blackwellの32バイトと比較して64バイトのKステップでオペランドを2倍の速度で消費します。
  • テンソルメモリは576列に増加し、.exclusive修飾子を通じてアクセス可能な追加の32 KiBを提供します。
  • 共有メモリは動的に328 KiBまで拡張可能であり、B側コレクタバッファによりオペランドの再利用が可能になります。
  • tcgen05.commit.sync_restrict命令により、Aタイルの早期解放が有効になり、ロードと演算のデカップリングを実現します。
  • これらの機能の統合により、NVFP4のパフォーマンスは22 PFLOPSを超え、cuBLASおよびCuTE DSLと同等の性能を達成します。

これらの最適化は、テンソルコアが以前のBlackwellカーネルよりも速くデータを消費するボトルネックに対処し、新アーキテクチャ上で競争力のあるスループットを実現します。