Pesquisadores do CERIST na Argélia lançaram uma versão com fine-tune do modelo Qwen2.5-VL-3B, especificamente projetada para o reconhecimento de manuscritos históricos árabes. O projeto aborda os desafios significativos impostos pela caligrafia cursiva, ligaduras inconsistentes e vários artefatos de página, como foxing e bleed-through.
O modelo foi treinado usando um currículo em três etapas: pré-treinamento em texto árabe genérico, fine-tune em dados de manuscritos sem diacríticos e fine-tune final com os diacríticos restaurados. Ele emprega pré-processamento por tipo de manuscrito para lidar com orçamentos de pixels variados entre livros impressos, caligrafia cursiva, litografias e manuscritos rubricados. O melhor checkpoint atual atinge uma Taxa de Erro de Caracteres (CER) de 6,58% e uma Taxa de Erro de Palavras (WER) de 22,34%, superando benchmarks como HATFormer e a principal submissão do NAKBA 2026.
A equipe convida a fornecer feedback sobre a demo, especialmente em relação ao desempenho em amostras de manuscritos difíceis ou incomuns, para ajudar a melhorar o pipeline para Reconhecimento de Texto Manuscrito Árabe.