Shieldstral은 콘텐츠 검수를 정책 적응형 질문 답변 작업으로 구성하는 3B 오픈 가중치 다중 모달 안전 분류기로, 재학습 없이 추론 시 일반 언어 정책을 받아들일 수 있습니다. 이는 텍스트와 이미지 안전 평가를 통합하고 다양한 벤치마크에서 교정된 안전 점수를 제공하며 단일 16GB NVIDIA GPU에서 효율적으로 실행됩니다.

  • 텍스트 안전성 평가에서 크기 최대 7배의 가드레일 모델보다 우수하며 다중 모달 검수에서 새로운 최첨단 기록을 세웁니다.
  • 추론 시 자유 형식의 자연어 정책을 받아들여 재학습 없이 새로운 상황에 적응할 수 있습니다.
  • 단일 순전파의 yes/no 로짓에 대한 softmax 정규화를 통해 연속적인 교정된 안전 점수를 반환합니다.
  • 구별력을 가르치기 위해 의도적으로 대조된 쌍을 포함하여 지시-질문-문서 형식으로 통합된 이종 데이터 소스에서 훈련되었습니다.

이 접근 방식은 개발자가 제품 컨텍스트와 대상에 따라 안전 정의를 동적으로 적응시켜 모델 가중치에 내장된 고정된 해악 분류체계의 필요성을 피할 수 있게 합니다.