Falconチームは、Falcon-H1-Arabic基盤の上に構築され、アラブ首長国連邦のアラビア語(UAE)の Gulf 方言をネイティブレベルのニュアンスで理解し生成するための方言特化型大規模言語モデルである Falcon-Emirati-7B をリリースしました。このモデルは、現代標準アラビア語と UAE の Gulf 方言特有の語彙、トーン、文化的文脈との間のギャップに対応しています。
- Falcon-H1-Arabic の 7B バリアントを基盤とし、効率的な長文コンテキスト処理のためにハイブリッド Mamba-Transformer アーキテクチャを採用。
- 厳選されたアラブ首長国連邦のウェブデータ、アラブ首長国連邦の文化に関する現代標準アラビア語(MSA)コンテンツ、特定の用語集で制約された合成データの混合データセットで学習。
- Alyah ベンチマークで 84.83% の精度を達成し、より大規模な多言語モデルを上回る性能を示した。
- オープンエンドの生成において優れた方言忠実性を示し、ALLaM や Fanar などの競合モデルがほぼゼロのスコアであるのに対し、0.52 のスコアを獲得。
今回のリリースでは、一般的なアラビア語モデルはローカル方言での応答を求められても現代標準アラビア語にデフォルトで戻ってしまうため、文化的な適応にはターゲットを絞った方言適応が必要であると強調しています。