Mistral AI a publié Shieldstral 1.0 3B, un modèle à poids ouverts qui traite la modération de contenu comme une unique question par oui/non plutôt que de s'appuyer sur des catégories de préjudice fixes. Construit sur Ministral-3-3B-Base-2512 avec un encodeur visuel Pixtral, il permet aux opérateurs de définir des politiques via des invites en langage naturel lors de l'inférence sans réentraînement.

  • Affiche une moyenne F1 de 84,9 % sur la sécurité textuelle, égalant GPT-OSS-Safeguard-20B, et de 83,8 % sur la sécurité multimodale, devançant les lignes de base évaluées.
  • Entraîné sur environ 54,1 millions d'échantillons en utilisant des réécritures par contraste fratrie pour enseigner des violations spécifiques de politique.
  • Tient dans 16 Go de VRAM et émet un score de sécurité continu unique via un seul passage avant.
  • Les faiblesses incluent les performances sur les langues à ressources limitées, les entrées obscurcies et les documents très longs.

Le modèle permet une modération en temps réel et rentable pour divers contextes de déploiement en autorisant l'application dynamique des politiques par l'ingénierie d'invites.