L'équipe des noyaux de Together AI a optimisé la bibliothèque ThunderKittens pour exploiter les nouvelles fonctionnalités de la plateforme NVIDIA Vera Rubin NVL72, en ciblant spécifiquement une performance améliorée pour les multiplications matricielles NVFP4 et FP8.
- Les cœurs tensoriels Vera Rubin consomment les opérandes deux fois plus vite avec un pas K de 64 octets par rapport aux 32 octets de Blackwell.
- La mémoire tensorielle augmente à 576 colonnes, offrant 32 KiB supplémentaires accessibles via le qualificateur .exclusive.
- La mémoire partagée est dynamiquement extensible jusqu'à 328 KiB, et un tampon collecteur côté B permet la réutilisation des opérandes.
- L'instruction tcgen05.commit.sync_restrict permet la libération anticipée des tuiles A pour découpler les chargements du calcul.
- L'intégration de ces fonctionnalités pousse la performance NVFP4 au-delà de 22 PFLOPS, atteignant l'équivalence avec cuBLAS et CuTE DSL.
Ces optimisations adressent le goulot d'étranglement où les cœurs tensoriels consomment les données plus vite que les noyaux Blackwell précédents ne pouvaient les fournir, permettant un débit compétitif sur la nouvelle architecture.