أظهر اختبار ضغط وحدة معالجة الرسومات باستخدام نموذج Qwen2.5-7B-Instruct المجمد بدقة 4 بت على أسئلة الجسر في HotpotQA أن التوجيه الدقيق الواعي بالمهمة يحسن الكفاءة والدقة بشكل كبير تحت ظروف المشتتات العالية. قارنت الدراسة السياق الكامل المحدود مع مُختار دلالي واعٍ للاستعلام يحتفظ بـ 60% من الميزانية، مما كشف عن مكاسب كبيرة في السرعة والدقة.

  • انخفض متوسط توكنات الإدخال لـ Qwen بنسبة 41.32%، من 13,124.5 إلى 7,701.8.
  • انخفض وقت التعبئة المسبقة بنسبة 46.85%، من 870.8 مللي ثانية إلى 462.8 مللي ثانية.
  • انخفض زمن الاستجابة النهائي بما في ذلك الاختيار بنسبة 45.02%، من 943.9 مللي ثانية إلى 518.9 مللي ثانية.
  • انخفض استخدام ذاكرة الفيديو الذروة بمقدار 2.55 GiB، من 11.71 GiB إلى 9.16 GiB.
  • ارتفع درجة F1 للتوكنات بمقدار 0.0468، من 0.5342 إلى 0.5810.

تشير النتائج إلى أن الاحتفاظ بـ 60% فقط من السياق عبر التوجيه الدلالي يقلل من تكاليف الحوسبة مع إنتاج جودة إجابة أعلى، على الرغم من أن الاختبار يقيس بشكل محدد المتانة تجاه السياق الطويل وغير ذي الصلة بدلاً من الأداء في التوزيع الطبيعي.