Mistral AI ha lanzado Shieldstral 1.0 3B, un modelo de pesos abiertos que trata la moderación de contenido como una única pregunta de sí/no en lugar de depender de categorías fijas de daño. Construido sobre Ministral-3-3B-Base-2512 con un codificador visual Pixtral, permite a los operadores definir políticas mediante prompts en lenguaje natural durante la inferencia sin necesidad de reentrenamiento.
- Informa una F1 promedio del 84,9% en seguridad textual, empatando con GPT-OSS-Safeguard-20B, y del 83,8% en seguridad multimodal, liderando las líneas base evaluadas.
- Entrenado con aproximadamente 54,1M de muestras utilizando reescrituras hermanas contrastivas para enseñar violaciones específicas de políticas.
- Cabe en 16GB de VRAM y emite una única puntuación continua de seguridad mediante un solo pase hacia adelante.
- Las debilidades incluyen el rendimiento en idiomas con pocos recursos, entradas ofuscadas y documentos muy largos.
El modelo permite una moderación en tiempo real y rentable para diversos contextos de despliegue al posibilitar la aplicación dinámica de políticas mediante ingeniería de prompts.