Des chercheurs du CERIST en Algérie ont publié une version affinée du modèle Qwen2.5-VL-3B, spécifiquement conçue pour la reconnaissance de manuscrits historiques arabes. Le projet répond aux défis importants posés par l'écriture cursive, les ligatures incohérentes et divers artefacts de page tels que le foxing et la transparence.
Le modèle a été entraîné selon un curriculum en trois étapes : pré-entraînement sur du texte arabe générique, affinage sur des données de manuscrits sans diacritiques, et affinage final avec les diacritiques restaurées. Il utilise un prétraitement par type de manuscrit pour gérer les budgets pixels variables entre les livres imprimés, l'écriture cursive, les lithographies et les manuscrits rubriqués. Le meilleur checkpoint actuel atteint un Taux d'Erreur de Caractère (CER) de 6,58 % et un Taux d'Erreur de Mot (WER) de 22,34 %, surpassant des benchmarks tels que HATFormer et la meilleure soumission NAKBA 2026.
L'équipe invite à donner son avis sur la démo, en particulier concernant les performances sur des échantillons de manuscrits difficiles ou inhabituels, afin d'aider à améliorer le pipeline pour la Reconnaissance de Texte Manuscrit Arabe.