Mistral AI telah merilis Shieldstral 1.0 3B, model open-weights yang memperlakukan moderasi konten sebagai pertanyaan ya/tidak tunggal alih-alih mengandalkan kategori bahaya tetap. Dibangun di atas Ministral-3-3B-Base-2512 dengan encoder visi Pixtral, model ini memungkinkan operator mendefinisikan kebijakan melalui prompt bahasa alami pada saat inferensi tanpa perlu pelatihan ulang.
- Mencapai rata-rata F1 sebesar 84,9% untuk keamanan teks, menyamai GPT-OSS-Safeguard-20B, dan 83,8% untuk keamanan multimodal, memimpin baselines yang dievaluasi.
- Dilatih pada sekitar 54,1M sampel menggunakan rewrite kontrasif saudara untuk mengajarkan pelanggaran kebijakan spesifik.
- Muat dalam VRAM 16GB dan menghasilkan satu skor keamanan kontinu melalui satu forward pass.
- Kelemahan meliputi kinerja pada bahasa dengan sumber daya rendah, input yang diobfusikasi, dan dokumen yang sangat panjang.
Model ini memungkinkan moderasi real-time dan hemat biaya untuk berbagai konteks penayangan dengan memungkinkan penegakan kebijakan dinamis melalui rekayasa prompt.