A Mistral AI lançou o Shieldstral 1.0 3B, um modelo de pesos abertos que trata a moderação de conteúdo como uma única pergunta sim/não, em vez de depender de categorias fixas de dano. Construído sobre o Ministral-3-3B-Base-2512 com um codificador visual Pixtral, permite que operadores definam políticas por meio de prompts em linguagem natural no momento da inferência, sem necessidade de retreinamento.
- Relata F1 médio de 84,9% na segurança de texto, empatando com o GPT-OSS-Safeguard-20B, e 83,8% na segurança multimodal, liderando as bases avaliadas.
- Treinado em aproximadamente 54,1M amostras usando reescritas contrastivas entre irmãos para ensinar violações específicas de política.
- Cabe em 16GB de VRAM e emite uma única pontuação contínua de segurança por meio de um único forward pass.
- Fraquezas incluem desempenho em idiomas com poucos recursos, entradas ofuscadas e documentos muito longos.
O modelo permite moderação em tempo real e econômica para diversos contextos de implantação, possibilitando a aplicação dinâmica de políticas por meio de engenharia de prompts.