Shieldstral adalah pengklasifikasi keamanan multimodal open-weights 3B yang membingkai moderasi konten sebagai tugas penjawab pertanyaan yang adaptif terhadap kebijakan, sehingga memungkinkan penerimaan kebijakan dalam bahasa alami pada saat inferensi tanpa pelatihan ulang. Model ini menyatukan evaluasi keamanan teks dan gambar serta memberikan skor keamanan terkalibrasi di berbagai benchmark sambil berjalan secara efisien pada satu GPU NVIDIA 16GB.
- Mengungguli model guardrail hingga 7x ukurannya pada keamanan teks dan menetapkan state of the art baru pada moderasi multimodal.
- Menerima kebijakan bahasa alami bebas-form pada saat inferensi, memungkinkan adaptasi ke konteks baru tanpa pelatihan ulang.
- Mengembalikan skor keamanan terkalibrasi secara kontinu melalui normalisasi softmax dari logit ya/tidak dari satu kali forward pass.
- Dilatih pada sumber data heterogen yang digabungkan menjadi format instruksi-pertanyaan-dokumen dengan pasangan kontrastif yang disengaja untuk mengajarkan diskriminasi.
Pendekatan ini memungkinkan pengembang menyesuaikan definisi keamanan secara dinamis berdasarkan konteks produk dan audiens, menghindari kebutuhan akan taksonomi bahaya tetap yang tertanam dalam bobot model.