Benchmark · multimodal

CharXiv

5 परिणाम 5 मॉडल

CharXiv एक बेंचमार्क है जो जाँचता है कि मल्टीमॉडल LLM, arXiv पेपरों से लिए गए वास्तविक वैज्ञानिक चार्ट को कितनी अच्छी तरह समझते हैं; यह वर्णनात्मक प्रश्नों (चार्ट के बुनियादी तत्व पढ़ना) और तर्क वाले प्रश्नों (मानों की तुलना व विश्लेषण) के लिए सटीकता अलग-अलग रिपोर्ट करता है।

और पढ़ें
उदाहरण
किसी चार्ट की छवि दिए जाने पर, एक वर्णनात्मक कार्य शीर्षक पढ़ने, लेजेंड की प्रविष्टियाँ गिनने या किसी टिक लेबल को बताने को कह सकता है, जबकि एक तर्क कार्य दो आलेखित श्रेणियों की तुलना कर किसी बिंदु पर कौन बड़ी है यह बताने को कह सकता है — यह सब केवल चार्ट की दृश्य सामग्री से ही उत्तर देने योग्य होता है।
स्कोरिंग
हर प्रश्न का उत्तर संक्षिप्त और मुक्त-प्रारूप में होता है। GPT-4o एक स्वचालित निर्णायक की तरह काम करता है जो मॉडल का उत्तर निकालता है और मानव-सत्यापित सही उत्तर के मुकाबले द्विआधारी सही/गलत अंक देता है; स्कोर सटीकता (सही प्रतिशत) है, जो वर्णनात्मक और तर्क उपसमुच्चयों के लिए अलग-अलग रिपोर्ट की जाती है।
सत्यापन
सभी 2,323 चार्ट, उनके प्रश्न और संदर्भ उत्तर मानव विशेषज्ञों द्वारा हाथ से तैयार और सत्यापित किए गए हैं; किसी उत्तर को सही तभी स्वीकार किया जाता है जब GPT-4o निर्णायक उसे संदर्भ उत्तर से मेल खाता हुआ मानता है, और रिपोर्ट की गई मानव सटीकता (तर्क पर लगभग 80.5%) संदर्भ सीमा के रूप में काम करती है।
यह क्यों मायने रखता है
वैज्ञानिक पेपरों और वित्तीय रिपोर्टों पर MLLM लगाने के लिए चार्ट पढ़ना केंद्रीय है, पर पुराने बेंचमार्क सरल, टेम्पलेट-आधारित चार्ट इस्तेमाल करते थे जो प्रगति को बढ़ा-चढ़ाकर दिखाते थे; CharXiv के स्वाभाविक और विविध arXiv चार्ट सर्वश्रेष्ठ मॉडलों और मनुष्यों के बीच बड़ा अंतर उजागर करते हैं, जिससे यह दृश्य तर्क की एक कठिन और यथार्थवादी परीक्षा बन जाता है।
हल किया गया उदाहरण
कार्य
[तर्क का उदाहरणात्मक आइटम] «Validation Accuracy by Model Size» शीर्षक वाला एक समूहीकृत बार चार्ट। X-अक्ष: मॉडल आकार (7B, 13B, 70B); Y-अक्ष: सटीकता (%)। हर समूह में दो बार, Dataset A और Dataset B: 7B → A=61, B=58; 13B → A=68, B=62; 70B → A=79, B=71। प्रश्न (संक्षिप्त उत्तर दें): किस मॉडल आकार पर Dataset A और Dataset B के बीच सटीकता का अंतर सबसे बड़ा है?
समाधान
प्रति-समूह अंतर A − B: 7B → 61 − 58 = 3; 13B → 68 − 62 = 6; 70B → 79 − 71 = 8. सबसे बड़ा = 8 → उत्तर: 70B।
व्याख्या
यह तर्क वाला प्रश्न है क्योंकि केवल एक मान निकालने के बजाय सभी छह बार की ऊँचाइयाँ पढ़नी और उनके अंतर की तुलना करनी होती है; GPT-4o निर्णायक संक्षिप्त उत्तर को संदर्भ उत्तर «70B» से मिलाता है और द्विआधारी अंक देता है, जो तर्क-सटीकता मीट्रिक में जुड़ता है।
0 25 50 75 100 2024-06-20 2025-07-12 2026-08-03 Claude 3.5 Sonnet · 95.2 · 2024-06-20 o4-mini · 72 · 2025-04-17 GPT-5.2 Thinking · 88.7 · 2025-12-11 Inkling · 82 · 2026-07-17 Inkling-Small · 77.4 · 2026-08-03
Claude 3.5 Sonnet o4-mini GPT-5.2 Thinking Inkling Inkling-Small
समयरेखा
तारीख़ मॉडल स्कोर स्रोत
2026-08-03 Inkling-Small 77.4% थिंकिंग मशीन्स लैब ने 276B ओपन वेट्स मल्टीमोडल MoE मॉडल इंकलिंग-स्माल रिलीज़ किया
2026-07-17 Inkling 82.0% थिंकिंग मशीन्स लैब ने इंकलिंग जारी किया, एक 975B-पैरामीटर ओपन-वेट्स मल्टीमोडल MoE मॉडल
2025-12-11 GPT-5.2 Thinking 88.7% OpenAI ने GPT-5.2 जारी किया, जो कोडिंग और तर्कशीलता बेंचमार्क्स में Gemini 3 से बेहतर है
2025-04-17 o4-mini 72.0% OpenAI ने o4-mini जारी किया, जो एक तेज़ और सस्ता बहुआयामी तर्क मॉडल है
2024-06-20 Claude 3.5 Sonnet 95.2% एन्थ्रोपिक ने क्लॉड 3.5 सॉनेट के लिए कोडिंग और विज़न बेंचमार्क में सुधार के साथ एक एडेन्डम जारी किया