Benchmark · multimodal
Video-MME
Video-MME एक व्यापक बेंचमार्क है जो मल्टीमॉडल LLM की वीडियो समझ का मूल्यांकन करता है — छोटे, मध्यम और लंबे वीडियो पर। प्रदर्शन बहुविकल्पीय सटीकता (accuracy) के रूप में दिया जाता है, जो छह दृश्य डोमेन के 900 वीडियो (254 घंटे) पर मानव-अनुलेखित 2,700 प्रश्नों पर आधारित है।
और पढ़ें
- उदाहरण
- मॉडल एक वीडियो क्लिप देखता है (वैकल्पिक रूप से उसके सबटाइटल और ऑडियो ट्रैक के साथ) और चार विकल्पों वाला एक बहुविकल्पीय प्रश्न हल करता है, जिसमें समय के साथ दृश्य सामग्री पर तर्क करना होता है — उदाहरण के लिए, मध्यम-लंबाई की खेल क्लिप में घटनाओं के घटित होने का क्रम पहचानना।
- स्कोरिंग
- मीट्रिक सटीकता है: चार-विकल्प वाले प्रश्नों में से सही उत्तर दिए गए प्रश्नों का प्रतिशत। परिणाम आमतौर पर सबटाइटल के बिना और साथ, दोनों तरह से बताए जाते हैं, वीडियो अवधि (छोटा/मध्यम/लंबा) और डोमेन के अनुसार विभाजित, और फिर एक समग्र संख्या में औसत किए जाते हैं।
- सत्यापन
- मॉडल द्वारा चुना गया अक्षर (A/B/C/D) उसके आउटपुट से निकाला जाता है और विशेषज्ञ-अनुलेखित सही उत्तर से सटीक मिलान द्वारा तुलना की जाती है; सही उत्तरों का अनुपात ही सटीकता है। सभी वीडियो और प्रश्न मैन्युअल रूप से एकत्र और अनुलेखित किए जाते हैं ताकि डेटा लीक कम से कम हो, इसलिए संख्याएँ सार्वजनिक लीडरबोर्ड पर तुलनीय रहती हैं।
- यह क्यों मायने रखता है
- यह पहला व्यापक बेंचमार्क था जो मल्टीमॉडल LLM को वास्तविक वीडियो पर परखता है — विस्तृत अवधि-सीमा (लगभग एक घंटे तक) और विविध डोमेन में, कई मॉडैलिटी (फ़्रेम, सबटाइटल, ऑडियो) का उपयोग करते हुए — जो एकल-फ़्रेम पहचान के बजाय वास्तविक समय-आधारित तर्क और लंबे-वीडियो की समझ को उजागर करता है।
हल किया गया उदाहरण
कार्य
«ज्ञान» डोमेन से एक मध्यम-लंबाई (~10 मिनट) की क्लिप उसके सबटाइटल ट्रैक के साथ दी जाती है। प्रश्न: «प्रस्तुतकर्ता वर्णित तकनीक के व्यापक रूप से अपनाए जाने का मुख्य कारण क्या बताता है?» विकल्प: A) यह विकल्पों से सस्ती थी; B) इसमें किसी विशेष प्रशिक्षण की आवश्यकता नहीं थी; C) यह अधिक सुसंगत परिणाम देती थी; D) यह कानूनन अनिवार्य थी। (बेंचमार्क के प्रारूप में एक उदाहरणात्मक आइटम।)
समाधान
स्क्रीन पर दिख रहे दृश्यों को सबटाइटल/ऑडियो कथन के साथ जोड़ें, उन तीन विकल्पों को हटाएँ जिन्हें क्लिप समर्थन नहीं देती, और जिसे समर्थन देती है उसे चुनें। अंतिम उत्तर: C।
व्याख्या
Video-MME के प्रश्न चार विकल्पों में से एकमात्र-सही बहुविकल्पीय होते हैं, इसलिए ठीक एक विकल्प (C) क्लिप के साक्ष्य से मेल खाता है; ग्रेडिंग विशेषज्ञ के सही लेबल से अक्षर के सटीक मिलान पर होती है, और सटीकता (सही ÷ कुल) के रूप में अंकित की जाती है।
| तारीख़ | मॉडल | स्कोर | स्रोत |
|---|---|---|---|
| 2025-11-18 | Gemini 3 Pro | 87.6% | Google ने शीर्ष तर्क और बहुआयामी क्षमताओं के साथ Gemini 3 Pro जारी किया |
| 2025-11-18 | Gemini 3 Pro | 87.6% | Google ने Gemini 3 Pro को अत्याधुनिक तर्क और बहु-मोडल क्षमताओं के साथ जारी किया |
| 2025-06-05 | Gemini 2.5 06-05 | 84.8% | Google ने कोडिंग और तर्क में सुधार के साथ Gemini 2.5 06-05 प्रीव्यू जारी किया |
| 2024-06-20 | Claude 3.5 Sonnet | 94.7% | एन्थ्रोपिक ने क्लॉड 3.5 सॉनेट के लिए कोडिंग और विज़न बेंचमार्क में सुधार के साथ एक एडेन्डम जारी किया |