Mistral AIは、コンテンツモデレーションを固定された危害カテゴリに依存するのではなく、単なるyes/noの質問として扱うオープンウェイトモデル「Shieldstral 1.0 3B」をリリースしました。PixtralビジョンエンコーダとMinistral-3-3B-Base-2512を基盤として構築されており、再学習なしで推論時にプレーンな言語プロンプトを通じてポリシーを定義できます。
- テキスト安全においてGPT-OSS-Safeguard-20Bと同率の平均F1 84.9%、マルチモーダル安全では評価されたベースラインをリードする83.8%を記録。
- 特定のポリシー違反を教えるためにsibling-contrastive rewritesを使用して約54.1M件のサンプルでトレーニング。
- 16GB VRAMに収まり、1回のフォワードパスで単一の連続した安全スコアを出力。
- 弱みとしては、低リソース言語、難読化された入力、非常に長いドキュメントでのパフォーマンスが挙げられます。
このモデルは、プロンプトエンジニアリングを通じて動的なポリシー適用を可能にし、多様なデプロイメントコンテキストにおけるリアルタイムかつコスト効果の高いモデレーションを実現します。