Shieldstral एक 3B ओपन-वेट्स बहुमोडल सुरक्षा वर्गीकारक है जो सामग्री मॉडरेशन को एक पॉलिसी-अनुकूलित प्रश्न-उत्तर कार्य के रूप में परिभाषित करता है, जिससे इसे पुनः प्रशिक्षण के बिना निष्पादन समय पर साधारण भाषा की नीतियों को स्वीकार करने की क्षमता प्राप्त होती है। यह पाठ और छवि सुरक्षा मूल्यांकन को एकीकृत करता है और विभिन्न बेंचमार्क्स पर संतुलित सुरक्षा स्कोर प्रदान करते हुए एकल 16GB NVIDIA GPU पर कुशलता से चलता है।

  • पाठ सुरक्षा में अपने आकार से 7 गुना तक के गार्डरेल मॉडल को हराता है और बहुमोडल मॉडरेशन पर नई राज्य कला स्थापित करता है।
  • निष्पादन समय पर स्वतंत्र-प्रारूप प्राकृतिक भाषा की नीतियों को स्वीकार करता है, जिससे पुनः प्रशिक्षण के बिना नए संदर्भों के लिए अनुकूलन सक्षम होता है।
  • एकल फॉरवर्ड पास से हाँ/नहीं लॉगिट्स के सॉफ्टमैक्स सामान्यीकरण के माध्यम से एक निरंतर संतुलित सुरक्षा स्कोर देता है।
  • विषम डेटा स्रोतों पर प्रशिक्षित, जिन्हें निर्देश-प्रश्न-दस्तावेज़ प्रारूप में एकीकृत किया गया है और भेदभाव सिखाने के लिए जानबूझकर बनाए गए कंट्रास्टिव पेयर शामिल हैं।

यह दृष्टिकोण डेवलपर्स को उत्पाद संदर्भ और दर्शकों के आधार पर सुरक्षा परिभाषाओं को गतिशील रूप से अनुकूलित करने की अनुमति देता है, जिससे मॉडल वेट्स में एकीकृत स्थिर हानि वर्गीकरणों की आवश्यकता से बचा जाता है।