يسمح خادم llama.cpp الآن بـ RANK pooling batch splitting لمُعيد ترتيب نماذج LLM السببية مثل Qwen3 وQwen3-VL، مما يحل القيود السابقة التي كانت تُفسد إعادة الترتيب للمستندات الطويلة والمتعددة الوسائط.
- في السابق، كان الخادم يرفض مدخلات RANK-pooling الأكبر من n_ubatch، مما يجبر جميع الرموز (tokens) على الدخول في دفعة فيزيائية واحدة.
- يكشف الإصلاح عن llama_get_causal_attn وllama_model_is_causal للتحقق ديناميكيًا من أنواع الانتباه بدلاً من التحقق الصارم من البنية.
- يسمح can_split() الآن بـ chunked prefill لـ RANK pooling عندما يكون السياق سببيًا، مما يزيل المنطق المكرر في مُنشئ الرسم البياني.
يتيح هذا التغيير معالجة فعالة للمستندات الطويلة والمدخلات متعددة الوسائط من خلال الاستفادة من قدرات chunked prefill الكامنة في النماذج السببية.