A equipe de kernels da Together AI otimizou a biblioteca ThunderKittens para aproveitar os novos recursos da plataforma NVIDIA Vera Rubin NVL72, com foco específico em melhorar o desempenho das multiplicações de matriz NVFP4 e FP8.

  • Os núcleos tensor do Vera Rubin consomem operandos duas vezes mais rápido com um passo K de 64 bytes em comparação com os 32 bytes do Blackwell.
  • A memória tensor aumenta para 576 colunas, fornecendo 32 KiB adicionais acessíveis por meio do qualificador .exclusive.
  • A memória compartilhada é dinamicamente expansível até 328 KiB, e um buffer coletor do lado B permite a reutilização de operandos.
  • A instrução tcgen05.commit.sync_restrict permite o liberação antecipada dos tiles A para desacoplar os carregamentos da computação.
  • A integração desses recursos eleva o desempenho NVFP4 para mais de 22 PFLOPS, alcançando paridade com cuBLAS e CuTE DSL.

Essas otimizações abordam o gargalo em que os núcleos tensor consomem dados mais rápido do que os kernels Blackwell anteriores podiam fornecê-los, permitindo uma taxa de transferência competitiva na nova arquitetura.