Together AI의 커널 팀은 NVIDIA Vera Rubin NVL72 플랫폼의 새로운 기능을 활용하기 위해 ThunderKittens 라이브러리를 최적화했으며, 이는 주로 NVFP4 및 FP8 행렬 곱셈의 성능 향상을 목표로 합니다.

  • Vera Rubin 텐서 코어는 Blackwell의 32바이트 대비 64바이트 K 단계로 피연산자를 두 배 더 빠르게 소비합니다.
  • 텐서 메모리가 576열로 증가하여 .exclusive 한정자를 통해 접근 가능한 추가 32 KiB를 제공합니다.
  • 공유 메모리는 동적으로 328 KiB까지 확장 가능하며, B측 수집기 버퍼를 통해 피연산자를 재사용할 수 있습니다.
  • tcgen05.commit.sync_restrict 명령어는 A 타일의 조기 해제를 가능하게 하여 로딩과 연산을 분리합니다.
  • 이러한 기능 통합으로 NVFP4 성능이 22 PFLOPS를 초과하여 cuBLAS 및 CuTE DSL과 동등한 성능을 달성했습니다.

이러한 최적화는 텐서 코어가 이전 Blackwell 커널이 공급할 수 있는 속도보다 빠르게 데이터를 소비하는 병목 현상을 해결하여, 새로운 아키텍처에서 경쟁력 있는 처리량을 가능하게 합니다.