Benchmark · multimodal
MathVista
MathVista معيار متعدد الوسائط يقيس الاستدلال الرياضي على المدخلات البصرية: الأشكال والمخططات والرسوم الهندسية والمنحنيات العلمية. يُبلَّغ عن الأداء بوصفه accuracy (الدقة): نسبة الأسئلة المُجاب عنها بشكل صحيح.
اقرأ المزيد
- مثال
- يجمع البند النموذجي بين صورة — رسم هندسي، أو منحنى دالة، أو مخطط أعمدة، أو جدول — وسؤال لا يُحلّ إلا بقراءة تفاصيل بصرية دقيقة ثم الاستدلال رياضيًا، مثل حساب طول من شكل مُعنون أو قراءة قيمة من مخطط. البنود إما متعددة الخيارات أو ذات إجابة حرة (عدد صحيح أو عشري أو قائمة).
- طريقة التقييم
- المقياس هو accuracy (الدقة). لأن الإجابات حرة أو متعددة الخيارات، يستخرج LLM أولًا الإجابة النهائية القصيرة من رد النموذج الكامل، ثم تُطبَّع وتُقارَن بالإجابة المرجعية بمطابقة تامة. الدقة هي نسبة البنود الصحيحة، ويُبلَّغ عنها أيضًا مفصَّلة حسب نوع المهمة ونوع الاستدلال.
- التحقق
- يستخدم التقييم قسمين: مجموعة testmini المكوّنة من 1000 بند بإجابات معلنة للتقييم محليًا، ومجموعة test أكبر تضم نحو 5141 بندًا إجاباتها محجوبة ولا تُقيَّم إلا بإرسال التنبؤات إلى لوحة الصدارة الرسمية للتقييم. تُحتسب النتيجة صحيحة عندما يقبلها مسار استخراج الإجابة مع المطابقة التامة.
- لماذا يهم
- معايير الرياضيات النصية فقط ومعايير الإجابة البصرية العامة عن الأسئلة يُغفل كلٌّ منها التقاطع الذي يستهدفه MathVista: رياضيات يستحيل حلّها دون فهم بصري حقيقي. كشف فجوة واسعة بين النماذج والبشر وصار مقياسًا معياريًا للاستدلال الرياضي البصري للنماذج الأساسية متعددة الوسائط.
مثال محلول
المهمة
صورة: مثلث قائم الزاوية ضلعاه القائمان مُعنونان بـ 6 و8. السؤال: «ما طول الوتر في الشكل؟» نوع الإجابة: عدد صحيح بإجابة حرة.
الحل
بحسب مبرهنة فيثاغورس، الوتر c = √(6² + 8²) = √(36 + 64) = √100 = 10. الإجابة النهائية: 10.
الشرح
يتطلب الحل قراءة أطوال الأضلاع المُعنونة من الرسم (فهم بصري) ثم تطبيق مبرهنة فيثاغورس (استدلال رياضي). التقدير: يستخرج LLM الإجابة القصيرة «10» من رد النموذج، وتُطابَق بالإجابة المرجعية بمطابقة تامة مُطبَّعة.
| التاريخ | النموذج | النتيجة | المصدر |
|---|---|---|---|
| 2026-08-13 | LFM2.5-VL-3B | 68.5% | Liquid AI تطلق LFM2.5-VL-3B، نموذج رؤية ولغة بحجم 3 مليار معامِل يعمل على الجهاز مع استدعاء الأدوات |
| 2025-05-26 | Alita | 74.0% | تُمكّن أليتا من الاستدلال الوكيل القابل للتوسع بأقل قدر ممكن من التعريف المسبق وأقصى حد من التطور الذاتي |
| 2025-04-17 | o4-mini | 84.3% | OpenAI تُطلق o4-mini، نموذج استدلالي متعدد الوسائط أسرع وأرخص |
| 2025-01-22 | Kimi k1.5 | 74.9% | كيمي k1.5 يوسع نطاق التعلم المعزز باستخدام نماذج لغوية كبيرة لمواكبة o1 والتفوق على النماذج ذات التفكير القصير |
| 2024-06-20 | Claude 3.5 Sonnet | 67.7% | أنثروبيك تطلق ملحقاً لـ Claude 3.5 Sonnet بمعايير محسّنة في البرمجة والرؤية |