Benchmark · multimodal

CharXiv

5 نتائج 5 نماذج

CharXiv هو معيار يختبر مدى فهم النماذج اللغوية الكبيرة متعددة الوسائط للرسوم البيانية العلمية الحقيقية المأخوذة من أوراق arXiv؛ ويُبلّغ عن الدقة بشكل منفصل للأسئلة الوصفية (قراءة العناصر الأساسية للرسم) وأسئلة الاستدلال (مقارنة القيم وتحليلها).

اقرأ المزيد
مثال
بالنظر إلى صورة رسم بياني، قد تطلب المهمة الوصفية قراءة العنوان أو عدّ مدخلات وسيلة الإيضاح أو ذكر تسمية علامة تدريج، بينما قد تطلب مهمة الاستدلال مقارنة سلسلتين مرسومتين وتحديد أيّهما أكبر عند نقطة معينة — وكل ذلك يمكن الإجابة عنه من المحتوى المرئي للرسم وحده.
طريقة التقييم
لكل سؤال إجابة قصيرة حرة الصياغة. يعمل GPT-4o كحكم آلي يستخرج إجابة النموذج ويمنح درجة ثنائية صحيح/خطأ مقابل الإجابة المرجعية المتحقَّق منها بشرياً؛ والدرجة هي الدقة (نسبة الإجابات الصحيحة)، وتُبلَّغ بشكل منفصل للمجموعتين الفرعيتين الوصفية والاستدلالية.
التحقق
جميع الرسوم البيانية البالغ عددها 2,323 وأسئلتها وإجاباتها المرجعية مُنسَّقة يدوياً ومُتحقَّق منها بواسطة خبراء بشر؛ ولا تُقبل الإجابة كصحيحة إلا عندما يحكم مقيِّم GPT-4o بمطابقتها للمرجع، بينما تمثل الدقة البشرية المُبلَّغ عنها (نحو 80.5% في الاستدلال) السقف المرجعي.
لماذا يهم
قراءة الرسوم البيانية محورية عند تطبيق النماذج متعددة الوسائط على الأوراق العلمية والتقارير المالية، لكن المعايير السابقة استخدمت رسوماً بسيطة قائمة على قوالب بالغت في تقدير التقدم؛ أما رسوم arXiv الطبيعية والمتنوعة في CharXiv فتكشف فجوة كبيرة بين أفضل النماذج والبشر، مما يجعله اختباراً صعباً وواقعياً للاستدلال البصري.
مثال محلول
المهمة
[عنصر توضيحي للاستدلال] رسم بياني شريطي مُجمَّع بعنوان «Validation Accuracy by Model Size». المحور X: حجم النموذج (7B، 13B، 70B)؛ المحور Y: الدقة (%). لكل مجموعة شريطان، Dataset A و Dataset B: 7B → A=61, B=58؛ 13B → A=68, B=62؛ 70B → A=79, B=71. السؤال (أجب بإجابة قصيرة): عند أي حجم نموذج تكون فجوة الدقة بين Dataset A و Dataset B هي الأكبر؟
الحل
الفجوة لكل مجموعة A − B: 7B → 61 − 58 = 3؛ 13B → 68 − 62 = 6؛ 70B → 79 − 71 = 8. الأكبر = 8 → الإجابة: 70B.
الشرح
إنه سؤال استدلال لأنه يجب قراءة ارتفاعات الأشرطة الستة جميعها ومقارنة فروقها، وليس مجرد استخراج قيمة واحدة؛ ويطابق مقيِّم GPT-4o الإجابة القصيرة مع المرجع «70B» ويمنحها درجة ثنائية، مما يسهم في مقياس دقة الاستدلال.
0 25 50 75 100 2024-06-20 2025-07-12 2026-08-03 Claude 3.5 Sonnet · 95.2 · 2024-06-20 o4-mini · 72 · 2025-04-17 GPT-5.2 Thinking · 88.7 · 2025-12-11 Inkling · 82 · 2026-07-17 Inkling-Small · 77.4 · 2026-08-03
Claude 3.5 Sonnet o4-mini GPT-5.2 Thinking Inkling Inkling-Small
الجدول الزمني
التاريخ النموذج النتيجة المصدر
2026-08-03 Inkling-Small 77.4% مختبر الآلات المفكرة يُصدر Inkling-Small، وهو نموذج MoE متعدد الوسائط بوزن مفتوح يتكون من 276 مليار معلمة
2026-07-17 Inkling 82.0% مختبر الآلات المفكرة يُصدر إنكلنغ، نموذج MoE متعدد الوسائط بوزن مفتوح يحتوي على 975 مليار معلمة
2025-12-11 GPT-5.2 Thinking 88.7% OpenAI تطلق GPT-5.2، متفوقة على Gemini 3 في معايير البرمجة والاستدلال
2025-04-17 o4-mini 72.0% OpenAI تُطلق o4-mini، نموذج استدلالي متعدد الوسائط أسرع وأرخص
2024-06-20 Claude 3.5 Sonnet 95.2% أنثروبيك تطلق ملحقاً لـ Claude 3.5 Sonnet بمعايير محسّنة في البرمجة والرؤية