Together AI 的内核团队已优化 ThunderKittens 库,以利用 NVIDIA Vera Rubin NVL72 平台的新特性,专门提升 NVFP4 和 FP8 矩阵乘法的性能。

  • 与 Blackwell 的 32 字节 K 步长相比,Vera Rubin 张量核心的操作数消耗速度更快,K 步长为 64 字节。
  • 张量内存增加到 576 列,通过 .exclusive 限定符可额外访问 32 KiB。
  • 共享内存动态扩展至 328 KiB,B 侧收集器缓冲区允许操作数复用。
  • tcgen05.commit.sync_restrict 指令使 A 瓦片能够提前释放,从而解耦加载与计算。
  • 集成这些特性使 NVFP4 性能超过 22 PFLOPS,达到与 cuBLAS 和 CuTE DSL 持平的水平。

这些优化解决了张量核心消耗数据的速度快于先前 Blackwell 内核能够提供数据的瓶颈问题,从而在新架构上实现具有竞争力的吞吐量。