Investigadores del CERIST en Argelia han lanzado una versión ajustada finamente del modelo Qwen2.5-VL-3B diseñada específicamente para reconocer manuscritos históricos árabes. El proyecto aborda los importantes desafíos planteados por la escritura cursiva, las ligaduras inconsistentes y varios artefactos de página como el envejecimiento (foxing) y la traspasación de tinta.

El modelo se entrenó utilizando un currículo de tres etapas: preentrenamiento en texto árabe genérico, ajuste fino sobre datos de manuscritos sin diacríticos y ajuste fino final con los diacríticos restaurados. Emplea un preprocesamiento por tipo de manuscrito para manejar los diferentes presupuestos de píxeles entre libros impresos, escritura cursiva, litografías y manuscritos rubricados. El mejor punto de control actual alcanza una Tasa de Error de Caracteres (CER) del 6.58% y una Tasa de Error de Palabras (WER) del 22.34%, superando benchmarks como HATFormer y la presentación principal NAKBA 2026.

El equipo invita a proporcionar comentarios sobre la demostración, particularmente respecto al rendimiento en muestras de manuscritos difíciles o inusuales, para ayudar a mejorar la tubería de Reconocimiento de Texto Manuscrito Árabe.