Исследователи из CERIST в Алжире выпустили версию модели Qwen2.5-VL-3B, специально дообученную для распознавания арабских исторических рукописей. Проект решает значительные проблемы, связанные с курсивным почерком, непоследовательными лигатурами и различными артефактами страниц, такими как пожелтение и просвечивание текста.
Модель обучалась в три этапа: предварительное обучение на общем арабском тексте, дообучение на данных рукописей без диакритических знаков и финальное дообучение с восстановленными диакритическими знаками. Применяется предобработка для каждого типа рукописи, чтобы учитывать различия в пиксельных бюджетах для печатных книг, курсивного почерка, литографий и рукописей с рубрикованными заголовками. Текущая лучшая контрольная точка достигает Character Error Rate (CER) 6,58% и Word Error Rate (WER) 22,34%, превосходя такие бенчмарки, как HATFormer и лучшее решение NAKBA 2026.
Команда приглашает к обратной связи по демо-версии, особенно относительно производительности на сложных или необычных образцах рукописей, чтобы помочь улучшить конвейер распознавания арабского рукописного текста.