阿尔及利亚CERIST的研究人员发布了一个专门用于识别阿拉伯历史手稿的Qwen2.5-VL-3B模型微调版本。该项目解决了连笔书写、不一致的字形连接以及页面伪影(如霉斑和透墨)带来的重大挑战。
该模型采用三阶段课程学习进行训练:在通用阿拉伯文本上进行预训练,在无变音符号的手稿数据上进行微调,最后在有恢复变音符号的数据上进行最终微调。它采用针对每种手稿类型的预处理方法,以应对印刷书籍、连笔书写、石印版和朱砂标注手稿之间不同的像素预算。
当前最佳检查点在字符错误率(CER)上达到6.58%,在词错误率(WER)上达到22.34%,优于HATFormer和NAKBA 2026顶级提交等基准测试。
团队邀请对演示提供反馈,特别是关于困难或异常手稿样本的性能表现,以帮助改进阿拉伯手写文本识别的流水线。