يسعى مطور إلى الحصول على ملاحظات حول SpiralCoreAttention، وهو نموذج أولي تجريبي لاختيار السياق أثناء التدريب لضبط نماذج اللغات الكبيرة ذات الأوزان المفتوحة. بدلاً من معالجة تسلسلات طويلة كاملة خلال كل تمرير أمامي وعكسي، يختار النظام كتل رموز محددة من التسلسل للتدريب عليها، بينما يقيّم المحوّل الناتج على تسلسلات سياقية كاملة محفوظة.
أظهرت تجارب QLoRA الداخلية باستخدام Qwen2.5-7B-Instruct مع تكميم 4-bit NF4 على بطاقة RTX PRO 6000 Blackwell GPU واحدة تسريعاً متوسطاً في خطوة التدريب بنسبة 1.675× وتقليل الذاكرة المؤقتة للفيديو (VRAM) بمقدار 6.036 GB. لوحظت هذه النتائج عبر ثلاث بذور باستخدام تسلسلات مكونة من 8,192 رمز على مدى 48 خطوة تدريب مع تكوين سياق مختار بنسبة 60%.
يشدد المؤلف على أن هذه نتائج بحثية محلية، قصيرة الأمد، ومحدودة ببطاقة واحدة، وليست ادعاءات إنتاجية أو أدلة على التدريب المسبق الكامل بمقاييس أكبر. يطلب المنشور ملاحظات تقنية حول بروتوكول التقييم، ومقاييس الجودة المناسبة على مستوى المهمة، والأساسيات الراسخة، وأنماط الفشل المحتملة لاختبارها قبل التحقق.