Shieldstral est un classificateur de sécurité multimodal à poids ouverts de 3B paramètres qui formule la modération de contenu comme une tâche de réponse aux questions adaptative aux politiques, lui permettant d'accepter des politiques en langage naturel lors de l'inférence sans réentraînement. Il unifie l'évaluation de la sécurité du texte et de l'image et fournit des scores de sécurité calibrés sur divers benchmarks tout en s'exécutant efficacement sur une seule GPU NVIDIA 16 Go.

  • Surpasse les modèles de garde-fou jusqu'à 7 fois sa taille pour la sécurité textuelle et établit un nouvel état de l'art sur la modération multimodale.
  • Accepte des politiques en langage naturel libre lors de l'inférence, permettant une adaptation à de nouveaux contextes sans réentraînement.
  • Retourne un score de sécurité continu et calibré via la normalisation softmax des logits oui/non issus d'un seul passage avant.
  • Entraîné sur des sources de données hétérogènes consolidées dans un format instruction-requête-document avec des paires contrastives délibérées pour enseigner la discrimination.

Cette approche permet aux développeurs d'adapter dynamiquement les définitions de sécurité en fonction du contexte produit et du public, évitant le besoin de taxonomies de préjudice fixes intégrées dans les poids du modèle.