アルジェリアのCERISTの研究者たちは、アラビア語の歴史的写本の認識のために特別に設計されたQwen2.5-VL-3Bモデルのファインチューニング版をリリースしました。このプロジェクトは、流れるような筆記体、一貫性のない結合文字、foxingや滲みなどのさまざまなページ上のアーティファクトがもたらす重大な課題に対処しています。
モデルは3段階のカリキュラムでトレーニングされました:汎用アラビア語テキストでの事前学習、ダイアクリティカルマークなしの写本データでのファインチューニング、そしてダイアクリティカルマークを復元した最終的なファインチューニングです。印刷物、流れるような筆記体、リトグラフ、ルビケーションされた写本など、異なるピクセル予算に対応するために、写本タイプごとの前処理を採用しています。現在の最良のチェックポイントは、文字誤り率(CER)が6.58%、単語誤り率(WER)が22.34%で、HATFormerやNAKBA 2026の上位提出物などのベンチマークを上回る性能を示しています。
チームは、アラビア語筆記テキスト認識のパイプラインを改善するために、特に困難な写本サンプルや珍しいサンプルでのパフォーマンスに関するデモへのフィードバックを求めています。