Shieldstralは、コンテンツモデレーションをポリシー適応型の質問応答タスクとして位置づける3Bのオープンウェイト・マルチモーダル安全分類器であり、再学習なしで推論時に自然言語によるポリシーを受け入れることができる。テキストと画像の安全評価を統一し、多様なベンチマークで補正された安全スコアを提供しながら、単一の16GB NVIDIA GPU上で効率的に動作する。

  • テキストの安全性においてサイズが最大7倍のガードレールモデルを上回り、マルチモーダルモデレーションで新たな最先端を樹立。
  • 推論時に自由形式の自然言語ポリシーを受け入れ、再学習なしで新規コンテキストに適応可能。
  • 単一フォワードパスからのyes/noロジットのソフトマックス正規化により、連続した補正済み安全スコアを返す。
  • 異種データソースから統合された指示・クエリ・ドキュメント形式のデータと、識別力を教えるための意図的な対照的ペアで学習。

このアプローチにより、開発者はモデルの重みに組み込まれた固定された危害分類に頼らず、プロダクトのコンテキストや対象ユーザーに基づいて安全定義を動的に適応させることができる。