Shieldstral 是一个拥有 3B 参数的开源权重多模态安全分类器,它将内容审核框架化为一个策略自适应的问答任务,使其能够在推理时接受自然语言描述的策略而无需重新训练。它统一了文本和图像的安全评估,并在多个基准测试中提供校准后的安全评分,同时在单张 16GB NVIDIA GPU 上高效运行。

  • 在文本安全方面超越高达其规模 7 倍的护栏模型,并在多模态审核方面创下新的最先进水平。
  • 在推理时接受自由形式的自然语言策略,使其能够适应新语境而无需重新训练。
  • 通过对单次前向传播中是/否 logits 进行 softmax 归一化,返回连续的校准安全评分。
  • 使用整合为指令-查询-文档格式、并包含刻意对比样本以教授判别能力的异构数据源进行训练。

这种方法使开发人员能够根据产品语境和目标受众动态调整安全定义,避免依赖固化在模型权重中的固定危害分类体系。