Benchmark · general

IFEval

7 نتائج 7 نماذج

يقيس IFEval (Instruction-Following Eval) مدى موثوقية اتّباع نموذج اللغة لتعليمات التنسيق والقيود الصريحة التي يمكن للآلة التحقق منها داخل المُدخل، مثل قواعد الطول أو الصيغة. والدرجة هي النسبة المئوية لتلك التعليمات القابلة للتحقق التي يستوفيها النموذج فعليًا.

اقرأ المزيد
مثال
مُدخل مثل «اكتب ملخصًا في 3 نقاط بالضبط ودون استخدام أي فاصلة» — على النموذج أن ينتج إجابة تستوفي كل قيد مذكور.
طريقة التقييم
تُفحص كل إجابة آليًا مقابل قيودها القابلة للتحقق (عدد النقاط، عدد الكلمات، الأحرف الممنوعة، الكلمات المفتاحية الإلزامية، حالة الأحرف، إلخ)، والدرجة هي نسبة القيود المستوفاة، وتُذكر على مستوى التعليمة وعلى مستوى المُدخل كاملًا (استيفاء كل القيود) معًا.
التحقق
التحقق آليّ بالكامل: برنامج حتمي صغير يختبر كل قيد (مثلًا عدّ النقاط أو البحث عن الفواصل)، فلا يوجد أي تحكيم بشري أو تقييم من نموذج LLM آخر.
لماذا يهم
إنه يفصل قدرة النموذج على اتّباع التعليمات الدقيقة عن مدى صحة إجابته من حيث الوقائع، وهذا مهم لأن الالتزام الموثوق بالتنسيق والقيود هو ما يجعل النماذج صالحة للاستخدام في التطبيقات الحقيقية والمسارات الآلية.
مثال محلول
المهمة
اكتب نصيحة قصيرة حول كيفية الحفاظ على الإنتاجية أثناء العمل من المنزل، في فقرتين بالضبط. اكتب إجابتك بالكامل بأحرف lowercase صغيرة (لا يُسمح بالأحرف الكبيرة) ولا تستخدم أي فاصلة في أي مكان. أنهِ إجابتك بهذه العبارة تماماً: 'that is all.'
الحل
working from home rewards a bit of structure so pick three goals each morning and give every goal its own block of time on your calendar. put your phone in another room and take a short walk between blocks to reset your attention. a clear desk and a fixed start time help your brain shift into work mode fast. stop at a set hour and celebrate one finished task so you never drift toward burnout. that is all.
الشرح
تلتزم الإجابة بكل قيد قابل للتحقق: فقرتان بالضبط، ولا أحرف كبيرة، وصفر فواصل، والعبارة الختامية الدقيقة. يقيّم IFEval كل تعليمة عبر مدقق Python حتمي ويُبلغ عن الدقة الصارمة/المرنة على مستوى التعليمة وعلى مستوى الموجّه بأكمله (لا يُحتسب الموجّه إلا إذا نجحت جميع تعليماته).
0 25 50 75 100 2024-12-17 2025-10-15 2026-08-13 Falcon3-10B-Instruct · 78 · 2024-12-17 Falcon3-1B-Instruct · 54.4 · 2024-12-17 Claude 3.7 Sonnet · 93.2 · 2025-02-24 GPT-4.1 · 87.4 · 2025-04-14 GPT-5 · 95.9 · 2025-12-15 Agents-A1 · 80.6 · 2026-07-06 LFM2.5-VL-3B · 82.3 · 2026-08-13
Falcon3-10B-Instruct Falcon3-1B-Instruct Claude 3.7 Sonnet GPT-4.1 GPT-5 Agents-A1 LFM2.5-VL-3B
الجدول الزمني
التاريخ النموذج النتيجة المصدر
2026-08-13 LFM2.5-VL-3B 82.3% Liquid AI تطلق LFM2.5-VL-3B، نموذج رؤية ولغة بحجم 3 مليار معامِل يعمل على الجهاز مع استدعاء الأدوات
2026-07-06 Agents-A1 80.6pts توسيع الأفق وليس المعلمات: بلوغ أداء النليون مع وكيل بحجم 35 مليار
2025-12-15 GPT-5 95.9% تسينغهوا ومجموعة أنت تكتشفان انخفاض موثوقية اتباع التعليمات في نماذج اللغات الكبيرة بنسبة تصل إلى 61.8% على التلميحات الدقيقة
2025-04-14 GPT-4.1 87.4% OpenAI تطلق عائلة GPT-4.1 مع سياق يتكون من مليون توكن وتحسينات في البرمجة
2025-02-24 Claude 3.7 Sonnet 93.2% أنثروبيك تطلق كلاود 3.7 سونيت مع تحكم ديناميكي في التفكير
2024-12-17 Falcon3-10B-Instruct 78.0% عائلة Falcon3 تطلق خمسة نماذج مفتوحة المصدر بقدرات محسّنة في العلوم والرياضيات والبرمجة
2024-12-17 Falcon3-1B-Instruct 54.4% عائلة Falcon3 تطلق خمسة نماذج مفتوحة المصدر بقدرات محسّنة في العلوم والرياضيات والبرمجة