أطلق باحثون في CERIST بالجزائر نسخة مُخصصة بدقة من نموذج Qwen2.5-VL-3B مصممة خصيصًا للتعرف على المخطوطات التاريخية العربية. يتناول المشروع التحديات الكبيرة التي تفرضها الكتابة بخط متصل، والروابط غير المتسقة، ومختلف عيوب الصفحات مثل البقع الدموية والتسرب الحبري.

تم تدريب النموذج باستخدام منهجية تدريجية من ثلاث مراحل: التدريب المسبق على نصوص عربية عامة، ثم التخصيص الدقيق على بيانات المخطوطات بدون التشكيل، وأخيرًا التخصيص الدقيق مع استعادة التشكيل. يستخدم النظام معالجة مسبقة لكل نوع من المخطوطة للتعامل مع ميزانيات البكسل المتفاوتة عبر الكتب المطبوعة، والكتابة بخط متصل، والطباعة الحجرية، والمخطوطات المزخرفة.

يحقق أفضل نقطة تفتيش حاليًا معدل خطأ حرفي (CER) بنسبة 6.58% ومعدل خطأ كلماتي (WER) بنسبة 22.34%, متفوقًا على معايير مثل HATFormer وأعلى مشاركة في مسابقة NAKBA 2026.

يدعو الفريق إلى تقديم ملاحظات حول العرض التجريبي، لا سيما فيما يتعلق بالأداء على عينات المخطوطات الصعبة أو غير المعتادة، للمساعدة في تحسين خط الأنابيب للتعرف على النص المكتوب بخط اليد باللغة العربية.