알제지 CERIST의 연구진들은 아랍어 고전 사본 인식을 위해 특별히 설계된 Qwen2.5-VL-3B 모델의 파인튜닝 버전을 공개했습니다. 이 프로젝트는 연결된 필기체, 불일치하는 리게처(ligatures), 그리고 foxing과 번짐 현상 등 다양한 페이지 결함들이 제기하는 중대한 과제들을 해결합니다.
모델은 세 단계의 커리큘럼을 사용하여 학습되었습니다: 일반 아랍어 텍스트에 대한 사전 학습, 이모티콘이 제거된 사본 데이터에 대한 파인튜닝, 그리고 이모티콘이 복원된 최종 파인튜닝. 인쇄물, 연결된 필기체, 리토그래프, 붉은색으로 강조된 사본 등 다양한 픽셀 할당량을 처리하기 위해 사본 유형별 전처리를 사용합니다. 현재 가장 우수한 체크포인트는 문자 오류율(CER) 6.58%와 단어 오류율(WER) 22.34%를 달성했으며, HATFormer 및 NAKBA 2026의 상위 제출작과 같은 벤치마크들을 능가합니다.
팀에서는 아랍어 필기 텍스트 인식 파이프라인을 개선하는 데 도움이 되도록, 특히 어렵거나 특이한 사본 샘플에서의 성능에 대한 데모 피드백을 환영합니다.