Mistral AI ने Shieldstral 1.0 3B जारी किया है, एक ओपन-वेट्स मॉडल जो सामग्री मॉडरेशन को एक साधारण हाँ/नहीं प्रश्न के रूप में देखता है, बजाय निश्चित हानि श्रेणियों पर निर्भर करने के। Ministral-3-3B-Base-2512 और Pixtral विजन एन्कोडर पर बनाया गया, यह ऑपरेटरों को रीट्रेनिंग के बिना इनफरेंस समय में साधारण भाषा प्रॉम्प्स के माध्यम से नीतियों को परिभाषित करने की अनुमति देता है।
- टेक्स्ट सुरक्षा पर 84.9% औसत F1 दर्ज करता है, जो GPT-OSS-Safeguard-20B के बराबर है, और बहुमोडल सुरक्षा पर 83.8% के साथ मूल्यांकित बेलाइन्स की अगुवाई करता है।
- विशिष्ट नीति उल्लंघनों को सिखाने के लिए भाई-विरोधाभासी पुनर्लेखन का उपयोग करके लगभग 54.1M नमूनों पर प्रशिक्षित किया गया।
- यह 16GB VRAM में फिट होता है और एक फॉरवर्ड पास के माध्यम से एक सातत्यपूर्ण सुरक्षा स्कोर उत्पन्न करता है।
- कम संसाधन वाली भाषाओं, छिपे हुए इनपुट और बहुत लंबे दस्तावेजों पर प्रदर्शन सहित इसकी कमजोरियाँ हैं।
मॉडल प्रॉम्प इंजीनियरिंग के माध्यम से गतिशील नीति कार्यान्वयन की अनुमति देकर विविध तैनाती संदर्भों के लिए वास्तविक समय में, लागत-प्रभावी मॉडरेशन सक्षम बनाता है।