قام فريق النوى في Together AI بتحسين مكتبة ThunderKittens للاستفادة من الميزات الجديدة في منصة NVIDIA Vera Rubin NVL72، مع التركيز بشكل خاص على تحسين أداء ضرب المصفوفات بصيغتي NVFP4 و FP8.

  • تستهلك نوى Tensor في Vera Rubin المعاملات بسرعة مضاعفة بخطوة K بحجم 64 بايت مقارنة بـ 32 بايت في Blackwell.
  • تزداد ذاكرة Tensor إلى 576 عموداً، مما يوفر 32 KiB إضافية يمكن الوصول إليها عبر المؤهل .exclusive.
  • الذاكرة المشتركة قابلة للتوسع ديناميكياً لتصل إلى 328 KiB، ويسمح مخزن جمع الجانب B بإعادة استخدام المعاملات.
  • يتيح تعليمة tcgen05.commit.sync_restrict الإفراج المبكر عن بلاطات A لفصل عمليات التحميل عن الحساب.
  • يؤدي دمج هذه الميزات إلى تجاوز أداء NVFP4 لـ 22 PFLOPS، وتحقيق تكافؤ مع cuBLAS و CuTE DSL.

تعالج هذه التحسينات الاختناق حيث تستهلك نوى Tensor البيانات بسرعة أكبر مما يمكن للنوى السابقة من Blackwell تزويدها به، مما يتيح معدل نقل تنافسي على البنية الجديدة.