Mistral AI выпустила Shieldstral 1.0 3B, модель с открытыми весами, которая рассматривает модерацию контента как единый вопрос «да/нет», а не опирается на фиксированные категории вреда. Построена на базе Ministral-3-3B-Base-2512 с визуальным энкодером Pixtral, она позволяет операторам определять политики через текстовые подсказки во время вывода без переобучения.
- Показывает средний F1 84.9% на безопасности текста, сравниваясь с GPT-OSS-Safeguard-20B, и 83.8% на многомодальной безопасности, превосходя оцененные базовые модели.
- Обучена на примерно 54.1M примерах с использованием сиблинг-контрастных перефразирований для обучения конкретным нарушениям политики.
- Помещается в 16GB VRAM и выдает единый непрерывный балл безопасности за один прямой проход.
- Слабые стороны включают производительность на языках с низким ресурсом, зашифрованные входные данные и очень длинные документы.
Модель обеспечивает модерацию в реальном времени с низкой стоимостью для различных контекстов развертывания, позволяя динамическое применение политик через инженерные подсказки.