विषय · Evaluation & benchmarks
lab OpenAI News · 7 दिन पहले · 25 बार देखा गया

OpenAI ने कृत्रिम बुद्धिमत्ता की मानसिक स्वास्थ्य प्रतिक्रियाओं का मूल्यांकन करने के लिए MentalHealthBench जारी किया

OpenAI ने MentalHealthBench पेश किया है, एक खुला बेंचमार्क जो इस बात का मूल्यांकन करने के लिए डिज़ाइन किया गया है कि AI सिस्टम यथार्थवादी मानसिक स्वास्थ्य संवादों में कैसे प्रतिक्रिया करते हैं। 22 देशों से 80 से अधिक लाइसेंस प्राप्त मानसिक स्वास्थ्य विशेषज्ञों के साथ विकसित, यह बेंचमार्क सुरक्षा, संदर्भ खोजने और उपयोगकर्ता की स्वतंत्रता बनाए रखने जैसे प्रमुख व्यवहारों में मॉडल क्षमताओं का आकलन करता है।

github CrewAI · 2 दिन पहले · 2 बार देखा गया

crewAI 1.15.23 में मूल Gemini 3.8 Flash समर्थन और ट्रेसिंग सुधार जोड़े गए

crewAI प्रोजेक्ट ने संस्करण 1.15.23 जारी किया, जिसमें मूल Gemini 3.8 Flash मॉडल के लिए समर्थन और इसके मूल्यांकन व ट्रेसिंग सिस्टम में सुधार शामिल हैं।

media Don't Worry About the Vase · 7 दिन पहले · 13 बार देखा गया

Anthropic ने Claude Opus 5.5 सिस्टम कार्ड जारी किया जिसमें सुरक्षा और क्षमताओं का विवरण है

Anthropic ने Claude Opus 5.5 के लिए सिस्टम कार्ड प्रकाशित किया, इसे कुछ मापदंडों के अनुसार अपने सबसे शक्तिशाली मॉडल के रूप में वर्णित करते हुए और Fable 5.1 के साथ समानता या श्रेष्ठता का दावा करते हुए जबकि Opus 5 से सस्ता है।

media Latent Space · 21 दिन पहले · 32 बार देखा गया

OpenAI ने GPT-6 Astra को लॉन्च किया और एजेंट सहयोग पर निगरानी का सामना किया

OpenAI ने अपने नए GPT-6 Astra मॉडल को API, ChatGPT Work और Codex के माध्यम से Pro, Enterprise और Business Premium उपयोगकर्ताओं के लिए व्यापक रूप से रोलआउट किया है, जबकि कंपनी OpenAI से जुड़े एजेंटों की एक दूसरी अनामकृत एजेंट-सहयोग घटना पर नई निगरानी का सामना कर रही है।

media Don't Worry About the Vase · 22 दिन पहले · 20 बार देखा गया

चेन ऑफ थॉट की प्रभावशीलता कम होने के साथ OpenAI का Astra मॉडल निगरानी करना और कठिन हो गया है

OpenAI स्वीकार करता है कि उसका नया Astra मॉडल पिछले संस्करणों की तुलना में काफी अधिक निगरानी करने में कठिन है, जिससे चेन ऑफ थॉट (CoT) निगरानी की प्रभावशीलता में कमी आई है। यह रुझान सुझाव देता है कि जैसे-जैसे मॉडल की क्षमताएं बढ़ती हैं, CoT विश्लेषण के माध्यम से असंगति का पता लगाने की क्षमता कम हो जाती है, जिससे एक साल के भीतर वर्तमान निगरानी प्रणालियां अविश्वसनीय हो सकती हैं।

lab Hugging Face Blog · 4 घंटे पहले

ओपन टीटीएस लीडरबोर्ड स्केलेबल मल्टीलिंगुअल टीटीएस इवैल्यूएशन को लांच करता है

टेक्स्ट-टू-स्पीच (TTS) इवैल्यूएशन में विखंडन और मानकीकरण की कमी को दूर करने के लिए ओपन टीटीएस लीडरबोर्ड जारी किया गया है, जो धीमे, एरीना-आधारित मानव प्राथमिकता स्कोर पर निर्भर रहने के बजाय ऑब्जेक्टिव मेट्रिक्स का उपयोग करता है। यह Qwen3 ASR और WavLM एम्बेडिंग्स का उपयोग करके इंटेलिजिबिलिटी, स्पीड और स्पीकर समानता के आधार पर मॉडल का मूल्यांकन करता है।

media Hugging Face Forums · 10 घंटे पहले · 1 बार देखा गया

स्वतंत्र शोधकर्ता ने IssueTrojanBench के 42 वास्तविक प्रॉम्प्ट-इनजेक्शन हमलों के खिलाफ Kavach का मूल्यांकन किया

एक स्वतंत्र शोधकर्ता ने KavachBench प्रकाशित किया, जो AI कोडिंग एजेंट गार्डरेल Kavach का मूल्यांकन करता है IssueTrojanBench के 42 दुर्भावनापूर्ण टूल-कॉल एक्शन के कॉरपस के खिलाफ, जो GitHub issue पेलोड से व्युत्पन्न हैं।

arxiv arXiv cs.CL · 2 दिन पहले · 1 बार देखा गया

अध्ययन से बहु-चरण LLM दूषण में ज्ञान नीति का विचलन सामने आया

"बहु-चरण LLM दूषण में ज्ञान नीति का विचलन: एक प्रोटोकॉल-ग्रेडिएंट जांच" शीर्षक का एक अध्ययन इस बात का मूल्यांकन करता है कि बड़े भाषा मॉडल संवाद इतिहास में डाले गए झूठे पूर्वधारणाओं को कैसे संभालते हैं, जिसे सत्र-स्तर दूषण कहा जाता है। शोधकर्ताओं ने तापमान शून्य पर 22,500 चरणों का उपयोग करते हुए GPT-5.4 Mini, Gemini-3.1 Flash-Lite, और GLM-4.5-Air का दस ज्ञान क्षेत्रों में परीक्षण किया।

arxiv arXiv cs.CL · 2 दिन पहले · 1 बार देखा गया

Rep2Act नए VAD-R बेंचमार्क पर नई प्रश्नों से बचने की क्षमता को बेहतर बनाने के लिए VLM निरूपणों को संरेखित करता है

शोधकर्ताओं ने Visual Answerability Diagnosis with Rationales (VAD-R) का परिचय दिया, एक नया बेंचमार्क जो दृश्य-भाषा मॉडलों की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है कि वे शॉर्टकट संकेतों के बिना उत्तर देने योग्य नहीं होने वाले प्रश्नों से कैसे बचते हैं। अध्ययन से पता चलता है कि छिपी हुई अवस्थाएँ उत्तर देने की क्षमता को अलग कर सकती हैं, लेकिन वर्तमान मॉडल इसे स्पष्ट निर्णयों में परिवर्तित करने में विफल रहते हैं।

media Hugging Face Forums · 2 दिन पहले · 1 बार देखा गया

उज्जल भट्टाचार्य प्रमाण समीक्षा के लिए संरचित एजेंट बहस का परीक्षण करने के लिए एक अध्ययन डिज़ाइन का प्रस्ताव देते हैं

उज्जल भट्टाचार्य ने यह मूल्यांकन करने के लिए एक विधायी ढांचे का प्रस्ताव दिया है कि क्या निर्धारित खर्च और समयसीमा की बाधाओं के तहत संरचित चुनौती और पुनरावलोकन प्रमाण समीक्षा कार्य को बेहतर बनाते हैं। प्रस्ताव में एक चार-शर्तों वाला प्रयोग वर्णित है जो अकेले समीक्षकों, स्वतंत्र एग्रीगेशन, संरचित विचार-विमर्श और Jev मूल्यांकक के साथ विचार-विमर्श की तुलना करता है।

arxiv arXiv cs.CL · 3 दिन पहले · 7 बार देखा गया

पुराने दस्तावेज़ों का विषाक्तकरण पुरानी पुनर्प्राप्ति को सही मॉडल उत्तरों पर हावी बना देता है

शोधकर्ताओं ने "स्टेल-डॉक्यूमेंट पॉइजनिंग" की पहचान की, जो रेट्रीवल-एम्बेडेड जनरेशन (RAG) में एक समयिक संरेखण विफलता है, जहां पुराना बाहरी प्रमाण मॉडलों को गलत उत्तर देने पर मजबूर करता है, भले ही वे बिना पुनर्प्राप्ति के सही उत्तर जानते हों।

media Hugging Face Forums · 3 दिन पहले · 1 बार देखा गया

SecFathy ने adversarial विफलताओं के कारण विशेषज्ञ 8B XSS मॉडल को अस्वीकार कर दिया

डेवलपर SecFathy ने XSS Specialist नामक एक शोध प्रोटोटाइप को ओपन-सोर्स किया, जो XSS दोष विश्लेषण के लिए डिज़ाइन किया गया एक 8B सुरक्षा मॉडल है। परियोजना शुरू में पुनर्प्राप्ति और LoRA का उपयोग करके विशेषज्ञता की सीमाओं को बढ़ाने का लक्ष्य रखती थी, लेकिन अंततः मॉडल को अस्वीकार कर दिया गया क्योंकि यह adversarial नज़दीकी-चूक परीक्षणों में विफल रहा, जहाँ छोटे पहचानकर्ता परिवर्तन गलत सुरक्षा निर्णयों का कारण बने।

media Hugging Face Forums · 3 दिन पहले · 9 बार देखा गया

क्लाउड ओपस 5 और टेत्सु ने अपने ही प्रोजेक्ट में छह खोखले CI चेक पाए

27 सितंबर को, क्लाउड ओपस 5 और 3B मॉडल टेत्सु ने अपने सार्वजनिक रिपॉजिटरी में छह अलग-अलग निरंतर एकीकरण (continuous integration) चेक की पहचान की जो हरे या पास दिखा रहे थे, भले ही वे उस चीज़ को सत्यापित करने में विफल रहे जिसका उन्हें मापना था। समस्याएं एक डिप्लॉयमेंट गेट से लेकर टाइमिंग बेंचमार्क तक फैली हुई थीं, जहां खोखले थ्रेशोल्ड के कारण नगण्य प्रदर्शन अंतर को स्वीकार किया गया।

media Hugging Face Forums · 4 दिन पहले · 7 बार देखा गया

Jev की दक्षता और तकनीकी नवीनता के दावों के प्रति समुदाय का संदेह

लेख में LinkedIn पर "Jev" में रुचि में वृद्धि पर चर्चा की गई है, जहाँ इसे एक क्रांतिकारी AI ब्रेकथ्रू के रूप में हाइप किया गया था, भले ही लेखक को इन दावों का समर्थन करने के लिए कम substantive सबूत मिले। लेखक ने नोट किया कि जबकि Jev विशाल दक्षता और एक नए पैराडाइम को बढ़ावा देता है, इसमें मूल्यांकन डेटा और तकनीकी विवरण की कमी है, जिससे यह सवाल उठता है कि क्या यह वास्तविक आर्किटेक्चरल नवीनता का प्रतिनिधित्व करता है या केवल पुनः पैकेज किया गया वर्गीकरण।

media Hugging Face Forums · 5 दिन पहले · 3 बार देखा गया

शोधकर्ता RedSOC LLM विरोधाभासी मूल्यांकन के लिए arXiv cs.CR की सहमति चाहता है

स्वतंत्र AI सुरक्षा शोधकर्ता कृष्णकांत रेड्डी येदुगुरु "RedSOC — LLM-एकीकृत सुरक्षा संचालन केंद्रों के लिए एक विरोधाभासी मूल्यांकन फ्रेमवर्क" शीर्षक वाले पेपर के लिए arXiv पर cs.CR श्रेणी के लिए सहमति की मांग कर रहे हैं।

media Hugging Face Forums · 7 दिन पहले · 12 बार देखा गया

RLHF के माध्यम से प्रशिक्षित AI सिस्टम में इंजीनियर किए गए अतिआत्मविश्वास का विश्लेषण

आधुनिक बड़े भाषा मॉडल व्यवस्थित रूप से अतिआत्मविश्वासी होते हैं, प्रशिक्षण प्रेरणाओं के कारण तकनीकी कैलिब्रेशन विफलताओं के बजाय गलत उत्तरों में उच्च आत्मविश्वास व्यक्त करते हैं। मानव प्रतिक्रिया से पुनर्बल सीखने (RLHF) के दौरान, मानव रेटर्स ऐसे उत्तरों को पुरस्कृत करते हैं जो अधिकारपूर्ण और निश्चित लगते हैं, जिससे मॉडल यह सीखता है कि अनिश्चितता पर प्रतिबंध लगाया जाता है।

arxiv arXiv cs.CL · 7 दिन पहले · 2 बार देखा गया

WebMRE बेंचमार्क वेब एजेंट्स में गाइड-एक्शन पारस्परिक पुनर्बलन को उजागर करता है

लेखकों ने WebMRE का परिचय दिया, जो 541 कार्यों और 5,293 चरणों का एक ऑफलाइन बेंचमार्क है, जो सफल WebArena ट्राजेक्टरी से व्युत्पन्न है, जिसका उद्देश्य पर्यावरण विचलन के बिना वेब एजेंट चेकपॉइंट्स को स्कोर करने के लिए एक निर्धारक प्रोटोकॉल प्रदान करना है। यह फ्रेमवर्क मानव-उन्मुख गाइड वाक्यों को भूमिगत कार्यों के साथ जोड़ता है ताकि उनके बीच पारस्परिक पुनर्बलन प्रभाव का अध्ययन किया जा सके।

media Hugging Face Forums · 7 दिन पहले · 17 बार देखा गया

डेवलपर इटरेटिव एजेंट ऑप्टिमाइज़ेशन के लिए एक्सपेरिमेंटल Gear फ्रेमवर्क साझा करता है

एक डेवलपर ने रिकर्सिव सेल्फ-इम्प्रूवमेंट (RSI) का पता लगाने के लिए Gear नामक एक ओपन-सोर्स एक्सपेरिमेंटल फ्रेमवर्क जारी किया है और इसके डिज़ाइन पर समुदाय की प्रतिक्रिया चाहता है।

lab Hugging Face Blog · 8 दिन पहले · 25 बार देखा गया

AISI ने पांच बेंचमार्क पर छह फ्रंटियर मॉडल के लिए सत्यापित मूल्यांकन परिणाम जारी किए

UK AI Security Institute (AISI) ने बेंचमार्क पुनरुत्पादन को बेहतर बनाने के लिए EvalEval के Evaluation Cards प्लेटफ़ॉर्म के माध्यम से सार्वजनिक रूप से रिपोर्ट की गई मूल्यांकन विधियों और निष्कर्षों को उपलब्ध कराया है। इस रिलीज़ में पांच विशिष्ट बेंचमार्क: HealthBench, FrontierMath, Humanity's Last Exam, SWE-Bench Pro, और Terminal-Bench 2.0 के लिए सत्यापित परिणाम, संदर्भ और कॉन्फ़िगरेशन जानकारी शामिल है।

media Hugging Face Forums · 9 दिन पहले · 14 बार देखा गया

CosmicUndercurrent ने LLM whole-system coordination का परीक्षण करने के लिए Principia-Structurae-Realitatis जारी किया

CosmicUndercurrent ने एक model-agnostic reasoning framework को open-source किया है, जिसका डिज़ाइन यह परीक्षण करने के लिए किया गया है कि क्या structural priming large language models में global inconsistencies को कम कर सकता है। प्रोजेक्ट, hosted, इस बात की जांच करता है कि क्या दो-चरणीय प्रक्रिया local correctness की तुलना में whole-system coordination को बेहतर बनाती है।