शोधकर्ताओं ने GPQA प्रस्तुत किया है, जो जीव विज्ञान, भौतिकी और रसायन विज्ञान में क्षेत्र विशेषज्ञों द्वारा लिखे गए 448 बहुविकल्पीय प्रश्नों का एक चुनौतीपूर्ण डेटासेट है। बेंचमार्क को अत्यंत कठिन बनाया गया है; पीएचडी-स्तर के विशेषज्ञ केवल 65% सटीकता प्राप्त करते हैं, जबकि कुशल गैर-विशेषज्ञ तकनीकी रूप से भी 34% तक पहुंचते हैं, भले ही उन्हें असीमित वेब एक्सेस हो। शीर्ष AI प्रणालियां भी संघर्ष कर रही हैं, जिसमें सबसे मजबूत GPT-4 बेलाइन केवल 39% सटीकता प्राप्त करती है। मानव और फ्रंटियर मॉडल दोनों के लिए इस कठिनाई का उद्देश्य वैज्ञानिक ज्ञान विकास में AI आउटपुट की निगरानी के लिए यथार्थवादी स्केलेबल ओवरसाइट प्रयोगों को सक्षम बनाना है।
GPQA: एक ग्रेजुएट-स्तर का Google-प्रूफ Q&A बेंचमार्क
Benchmarks
| Benchmark | मॉडल | स्कोर |
|---|---|---|
| GPQA Diamond | GPT-4 based baseline | 39% |
M$^3$R-Bench बहुआयामी रूपक समझ के लिए प्रमाण-आधारित मानदंड का परिचय देता है
शोधकर्ताओं ने M$^3$R-Bench पेश किया, एक एकीकृत मानदंड जिसमें 1,000 छवि-पाठ उदाहरण शामिल हैं, जिनमें प्रमाण-आधारित बहुआयामी रूपक समझ का मूल्यांकन करने के लिए मानव-सत्यापित टिप्पणियाँ दी गई हैं। यह मानदंड रूपक की उपस्थिति, लक्ष्य-स्रोत मैपिंग, भावनात्मक स्थिति और अवधारणात्मक रूपक सिद्धांत पर आधारित चरण-दर-चरण व्याख्याओं के लिए संयुक्त टिप्पणियाँ प्रदान करता है।
Zing फ्रेमवर्क SoMBench बेंचमार्क और Actio ग्रौंडिंग के माध्यम से LLM सामाजिक बुद्धिमत्ता को सुधारता है
रिपोर्ट में Zing का परिचय दिया गया है, एक एकीकृत फ्रेमवर्क जिसे बड़े भाषा मॉडलों की सामाजिक बुद्धिमत्ता को मापने, आंतरिक करने और ग्रौंडिंग के द्वारा बढ़ाने के लिए डिज़ाइन किया गया है। लेखकों ने SoMBench प्रस्तुत किया है, एक मनोविज्ञान-आधारित बेंचमार्क जो 17 द्वितीयक आयामों और 3,481 विशेषज्ञ-सत्यापित उदाहरणों को कवर करता है, जो दर्शाता है कि वर्तमान LLMs में सुधार के लिए महत्वपूर्ण स्थान है और कोई भी मॉडल लगभग शीर्ष प्रदर्शन तक नहीं पहुँचा।
SRRM बेंचमार्क दिखाता है कि Qwen2.5-1.5B लंबे संदर्भ मेमोरी में 3B को हराता है
एक शोधकर्ता Simple Retrieval-Reconstruction Memory (SRRM) पेश करने वाले एक पेपर के लिए arXiv cs.CL की स्वीकृति चाहते हैं, जो Small Language Models में लंबे संदर्भ मेमोरी का मूल्यांकन करने के लिए डिज़ाइन किया गया एक हल्का बेंचमार्क है।
गुणों के साथ LLM फाइन-ट्यूनिंग क्रॉस-रूब्रिक निबंध स्कोरिंग को बेहतर बनाता है
शोधकर्ता स्वचालित निबंध स्कोरिंग की चुनौती को संबोधित करते हैं जब शिक्षक नए रूब्रिक्स को संशोधित या पेश करते हैं, जिसे क्रॉस-रूब्रिक सामान्यीकरण के रूप में जाना जाता है। वे बड़े भाषा मॉडलों के लिए एक फाइन-ट्यूनिंग फ्रेमवर्क प्रस्तावित करते हैं जो प्रशिक्षण के दौरान लक्ष्य-निबंध पर्यवेक्षण के साथ "गुण" (traits) कहलाने वाले रूब्रिक-अज्ञात मध्यवर्ती प्रतिनिधित्वों का उपयोग करता है।
लाइव गुरबानी ट्रैकिंग: सिख कीर्तन कैप्शनिंग के लिए बेंचमार्क और रेफरेंस सिस्टम
लेखकों ने सिख कीर्तन की लाइव कैप्शनिंग के लिए एक बेंचमार्क और रेफरेंस सिस्टम प्रस्तुत किया है, जिसमें श्री गुरु ग्रंथ साहिब जी के श्लोकों का निरंतर गायकी में पाठ शामिल है। ओपन-वोकाब्युलरी ट्रांसक्रिप्शन के विपरीत, इस कार्य को धार्मिक रूप से अनुचित वर्तनी से बचने के लिए कैनोनिकल शास्त्र से शब्द-दर-शब्द सटीक मिलान की आवश्यकता होती है।