Mistral AI는 콘텐츠 검열을 고정된 해악 범주에 의존하는 대신 단일 예/아니오 질문으로 처리하는 오픈 가중치 모델인 Shieldstral 1.0 3B를 출시했습니다. Pixtral 비전 인코더와 함께 Ministral-3-3B-Base-2512를 기반으로 구축된 이 모델은 재학습 없이 추론 시 일반 언어 프롬프트를 통해 운영자가 정책을 정의할 수 있게 합니다.
- 텍스트 안전성에서 GPT-OSS-Safeguard-20B와 동점인 평균 F1 84.9%를 기록하고, 다중 모달 안전성에서는 평가된 베이스라인을 선도하는 83.8%를 달성했습니다.
- 특정 정책 위반 사항을 가르치기 위해 형제 대비 재작성을 사용하여 약 54.1M개의 샘플로 학습되었습니다.
- 16GB VRAM에 적합하며, 단일 순전파를 통해 연속적인 안전 점수를 출력합니다.
- 약점으로는 저자원 언어, 은닉된 입력, 매우 긴 문서에서의 성능이 포함됩니다.
이 모델은 프롬프트 엔지니어링을 통한 동적 정책 집행을 가능하게 함으로써 다양한 배포 맥락에서 실시간이고 비용 효율적인 검열을 가능하게 합니다.