El equipo de núcleos de Together AI ha optimizado la biblioteca ThunderKittens para aprovechar las nuevas características de la plataforma NVIDIA Vera Rubin NVL72, enfocándose específicamente en mejorar el rendimiento para multiplicaciones de matrices NVFP4 y FP8.
- Los núcleos tensor de Vera Rubin consumen operandos dos veces más rápido con un paso K de 64 bytes en comparación con los 32 bytes de Blackwell.
- La memoria tensor aumenta a 576 columnas, proporcionando 32 KiB adicionales accesibles mediante el calificador .exclusive.
- La memoria compartida es dinámicamente expandible hasta 328 KiB, y un búfer colector del lado B permite la reutilización de operandos.
- La instrucción tcgen05.commit.sync_restrict permite la liberación temprana de los tiles A para desacoplar las cargas de la computación.
- Integrar estas características impulsa el rendimiento NVFP4 a más de 22 PFLOPS, logrando paridad con cuBLAS y CuTE DSL.
Estas optimizaciones abordan el cuello de botella donde los núcleos tensor consumen datos más rápido de lo que los núcleos Blackwell anteriores podían suministrarlos, permitiendo un rendimiento competitivo en la nueva arquitectura.