Technology Innovation Instituteは、Falcon-H1-Arabicアーキテクチャを基盤として構築され、アラブ首長国連邦のアラビア語をネイティブレベルの精度で理解・生成するための方言特化型大規模言語モデルであるFalcon-Emirati-7Bをリリースしました。

このモデルは、ハイブリッドなState Space ModelとTransformerの注意力構造を活用し、形態的に豊かな言語に対する精密さを維持しつつ、長文シーケンスを効率的に処理します。トレーニングには、本物のアラブ首長国連邦のウェブデータ、地域の文化に焦点を当てたMSAコンテンツ、そして文法的および文化的忠実性を確保するための厳格に制約された合成データを組み合わせた専用パイプラインが用いられました。

Falcon-Emirati-7BはAlyahベンチマークで84.83%のスコアを獲得し、より大規模な多言語モデルを上回りました。自由記述生成テストでは、アラブ首長国連邦語で質問された場合でも現代標準アラビア語に依存しがちだったALLaMやJaisなどの競合他社と比較して、優れた方言忠実性を示しました。

今回のリリースは、方言能力がモデルの規模のみを頼りにするのではなく、標的を絞ったトレーニングを必要とすることを強調しており、UAE特有の語彙、トーン、文化的文脈という特定の課題に対応しています。