Mistral AI 发布了 Shieldstral 1.0 3B,这是一个开放权重的模型,它将内容审核视为一个简单的“是/否”问题,而不是依赖固定的危害类别。该模型基于 Ministral-3-3B-Base-2512 和 Pixtral 视觉编码器构建,允许操作员在推理时通过自然语言提示定义策略,而无需重新训练。
- 在文本安全方面报告了 84.9% 的平均 F1 分数,与 GPT-OSS-Safeguard-20B 持平;在多模态安全方面达到 83.8%,领先于已评估的基线模型。
- 使用大约 54.1M 个样本进行训练,采用兄弟对比重写技术来教授特定的策略违规行为。
- 仅需 16GB VRAM 即可运行,并通过一次前向传播输出一个连续的安全分数。
- 弱点包括在低资源语言、混淆输入和超长文档上的表现。
该模型通过允许通过提示工程实现动态策略执行,为各种部署场景提供了实时且成本效益高的审核能力。