Together AI 的内核团队已优化 ThunderKittens 库,以利用 NVIDIA Vera Rubin NVL72 平台的新特性,专门提升 NVFP4 和 FP8 矩阵乘法的性能。
- 与 Blackwell 的 32 字节 K 步长相比,Vera Rubin 张量核心的操作数消耗速度更快,K 步长为 64 字节。
- 张量内存增加到 576 列,通过 .exclusive 限定符可额外访问 32 KiB。
- 共享内存动态扩展至 328 KiB,B 侧收集器缓冲区允许操作数复用。
- tcgen05.commit.sync_restrict 指令使 A 瓦片能够提前释放,从而解耦加载与计算。
- 集成这些特性使 NVFP4 性能超过 22 PFLOPS,达到与 cuBLAS 和 CuTE DSL 持平的水平。
这些优化解决了张量核心消耗数据的速度快于先前 Blackwell 内核能够提供数据的瓶颈问题,从而在新架构上实现具有竞争力的吞吐量。