قام فريق النوى في Together AI بتحسين مكتبة ThunderKittens للاستفادة من الميزات الجديدة في منصة NVIDIA Vera Rubin NVL72، مع التركيز بشكل خاص على تحسين أداء ضرب المصفوفات بصيغتي NVFP4 و FP8.
- تستهلك نوى Tensor في Vera Rubin المعاملات بسرعة مضاعفة بخطوة K بحجم 64 بايت مقارنة بـ 32 بايت في Blackwell.
- تزداد ذاكرة Tensor إلى 576 عموداً، مما يوفر 32 KiB إضافية يمكن الوصول إليها عبر المؤهل .exclusive.
- الذاكرة المشتركة قابلة للتوسع ديناميكياً لتصل إلى 328 KiB، ويسمح مخزن جمع الجانب B بإعادة استخدام المعاملات.
- يتيح تعليمة tcgen05.commit.sync_restrict الإفراج المبكر عن بلاطات A لفصل عمليات التحميل عن الحساب.
- يؤدي دمج هذه الميزات إلى تجاوز أداء NVFP4 لـ 22 PFLOPS، وتحقيق تكافؤ مع cuBLAS و CuTE DSL.
تعالج هذه التحسينات الاختناق حيث تستهلك نوى Tensor البيانات بسرعة أكبر مما يمكن للنوى السابقة من Blackwell تزويدها به، مما يتيح معدل نقل تنافسي على البنية الجديدة.