أطلق مشروع llama.cpp دعم الانتباه المتقطع السريع (FA) للخلفية البرمجية Metal، مستهدفاً بشكل خاص مرحلة الحشو في استنتاج النموذج. يتضمن هذا التحديث نواة جديدة تضغط إدخالات القناع المحدودة في قوائم مؤشرات لكل صف، وتوسع نواة FA المتجه بإضافة تجميع مؤشرات متقطعة اختياري.
- يضيف التنفيذ بوابة على جانب المضيف لتمكين المسار المتقطع عندما يكون n_kv_max أكبر من 0 ويتم استيفاء شروط أخرى.
- تم تطبيق إصلاح لتصحيح أخطاء معالجة الصفوف في نوى الانتباه المتقطع السريع التي كانت تسبب فشل الحالات متعددة الصفوف سابقاً.
- أُضيفت تقنيات تحسين لأداء ضغط مؤشرات متقطعة بمرحلة واحدة، وتجنب قراءات القناع الزائدة عن طريق الاحتفاظ بالمواقع المحدودة في سجلات كل خيط.
- أُضيفت حالات اختبار ومعايير أداء للتحقق من أحجام الرؤوس، وأنواع الكمّنة، ومعلمات التكوين المختلفة.
يؤدي هذا التغيير إلى تحسين الكفاءة لمستخدمي Metal من خلال تقليل حركة المرور الذاكرة أثناء مرحلة الحشو عند استخدام تلميحات الانتباه المتقطع.