लैब · Allen AI
media Hugging Face Forums · 17 दिन पहले · 29 बार देखा गया

अध्ययन में ऐसे FragileTokens की पहचान हुई हैं जो अलगाव परीक्षणों में सफल होते हुए भी संदर्भित प्रतिलिपिकरण में विफल रहते हैं

एक अध्ययन ने "FragileTokens" का वर्णन किया है, जो ओपन-वेट भाषा मॉडलों में शब्दावली के एंट्री हैं जो अलग होने पर सफलतापूर्वक प्रतिलिपि बनाते हैं लेकिन आसपास के पाठ में शामिल होने पर त्रुटियां दिखाते हैं। शोध से पता चलता है कि साधारण अलगाव परीक्षणों द्वारा शाब्दिक पहचान की सुरक्षा सुनिश्चित नहीं होती, क्योंकि टोकन अनुक्रमों के भीतर हटाए जा सकते हैं, प्रतिस्थापित किए जा सकते हैं या काटे जा सकते हैं।

lab Hugging Face Blog · 29 दिन पहले · 34 बार देखा गया

BenchMIRT सुरक्षा और तर्क संकेतों को अलग करके LLM बेंचमार्क्स की ऑडिट करता है

शोधकर्ताओं ने BenchMIRT पेश किया, जो बहुआयामी आइटम रिस्पॉन्स थ्योरी (Item Response Theory) का उपयोग करके व्यक्तिगत प्रॉम्प्ट स्तर पर बड़े भाषा मॉडल बेंचमार्क्स की ऑडिट करने की एक विधि है। 100 मॉडलों और 34,000 प्रश्नों के प्रदर्शन का विश्लेषण करते हुए, यह उपकरण सुरक्षा और सामान्य तर्क जैसे मिश्रित क्षमताओं को अलग करता है जो अक्सर बेंचमार्क स्कोर को छिपा देते हैं।