Benchmark · general

IFEval

7 परिणाम 7 मॉडल

IFEval (Instruction-Following Eval) यह मापता है कि कोई भाषा मॉडल प्रॉम्प्ट में दिए गए स्पष्ट, मशीन द्वारा जाँचे जा सकने वाले फ़ॉर्मैट और बाध्यता संबंधी निर्देशों — जैसे लंबाई या फ़ॉर्मैट के नियम — का कितनी विश्वसनीयता से पालन करता है। स्कोर ऐसे जाँचने-योग्य निर्देशों का वह प्रतिशत है जिन्हें मॉडल वास्तव में पूरा करता है।

और पढ़ें
उदाहरण
जैसे कोई प्रॉम्प्ट «ठीक 3 बुलेट पॉइंट में सारांश लिखो और एक भी अल्पविराम इस्तेमाल मत करो» — मॉडल को ऐसा उत्तर देना होगा जो हर दी गई बाध्यता को पूरा करे।
स्कोरिंग
हर उत्तर को उसकी जाँचने-योग्य बाध्यताओं (बुलेट की संख्या, शब्दों की संख्या, वर्जित अक्षर, अनिवार्य कीवर्ड, बड़े/छोटे अक्षर आदि) के विरुद्ध स्वचालित रूप से परखा जाता है, और स्कोर पूरी हुई बाध्यताओं का प्रतिशत होता है, जिसे निर्देश-स्तर और पूरे प्रॉम्प्ट-स्तर (प्रॉम्प्ट की सभी बाध्यताएँ पूरी) दोनों पर बताया जाता है।
सत्यापन
सत्यापन पूरी तरह स्वचालित है: एक छोटा नियतात्मक प्रोग्राम हर बाध्यता को जाँचता है (उदाहरण के लिए, बुलेट गिनना या अल्पविराम ढूँढना), इसलिए इसमें कोई मानवीय निर्णय या किसी अन्य LLM द्वारा मूल्यांकन शामिल नहीं होता।
यह क्यों मायने रखता है
यह इस बात को अलग कर देता है कि मॉडल सटीक निर्देशों का पालन कर सकता है या नहीं, बनाम उसका उत्तर तथ्यात्मक रूप से सही है या नहीं; यह मायने रखता है क्योंकि फ़ॉर्मैट और बाध्यताओं का विश्वसनीय पालन ही मॉडलों को असली ऐप्लिकेशन और स्वचालित पाइपलाइनों में उपयोगी बनाता है।
हल किया गया उदाहरण
कार्य
घर से काम करते समय उत्पादक बने रहने के बारे में एक छोटी सलाह ठीक दो अनुच्छेदों में लिखें। पूरा उत्तर केवल lowercase अक्षरों में लिखें (बड़े अक्षर की अनुमति नहीं है) और कहीं भी कोई अल्पविराम (comma) का उपयोग न करें। उत्तर को ठीक इस वाक्यांश के साथ समाप्त करें: 'that is all.'
समाधान
working from home rewards a bit of structure so pick three goals each morning and give every goal its own block of time on your calendar. put your phone in another room and take a short walk between blocks to reset your attention. a clear desk and a fixed start time help your brain shift into work mode fast. stop at a set hour and celebrate one finished task so you never drift toward burnout. that is all.
व्याख्या
उत्तर हर सत्यापन-योग्य बाधा का पालन करता है: ठीक दो अनुच्छेद, कोई बड़ा अक्षर नहीं, शून्य अल्पविराम, और सटीक अंतिम वाक्यांश। IFEval प्रत्येक निर्देश को एक नियतात्मक (deterministic) Python सत्यापक से जाँचता है और निर्देश-स्तर तथा पूरे prompt-स्तर दोनों पर strict/loose सटीकता बताता है (कोई prompt तभी गिना जाता है जब उसके सभी निर्देश पास हों)।
0 25 50 75 100 2024-12-17 2025-10-15 2026-08-13 Falcon3-10B-Instruct · 78 · 2024-12-17 Falcon3-1B-Instruct · 54.4 · 2024-12-17 Claude 3.7 Sonnet · 93.2 · 2025-02-24 GPT-4.1 · 87.4 · 2025-04-14 GPT-5 · 95.9 · 2025-12-15 Agents-A1 · 80.6 · 2026-07-06 LFM2.5-VL-3B · 82.3 · 2026-08-13
Falcon3-10B-Instruct Falcon3-1B-Instruct Claude 3.7 Sonnet GPT-4.1 GPT-5 Agents-A1 LFM2.5-VL-3B
समयरेखा
तारीख़ मॉडल स्कोर स्रोत
2026-08-13 LFM2.5-VL-3B 82.3% Liquid AI ने LFM2.5-VL-3B जारी किया, जो टूल कॉलिंग के साथ एक 3B ऑन-डिवाइज विजन-लैंग्वेज मॉडल है
2026-07-06 Agents-A1 80.6pts पैरामीटर नहीं, क्षितिज को स्केल करें: एक 35B एजेंट के साथ ट्रिलियन-पैरामीटर प्रदर्शन प्राप्त करना
2025-12-15 GPT-5 95.9% त्सिंगह्वा और एंट ग्रुप को पता चला कि सूक्ष्म प्रॉम्प्ट्स पर एलएलएम निर्देश-अनुपालन विश्वसनीयता 61.8% तक गिर जाती है
2025-04-14 GPT-4.1 87.4% OpenAI ने GPT-4.1 परिवार को 1M टोकन संदर्भ और कोडिंग सुधारों के साथ जारी किया
2025-02-24 Claude 3.7 Sonnet 93.2% Anthropic ने Claude 3.7 Sonnet को गतिशील तर्क नियंत्रण के साथ जारी किया
2024-12-17 Falcon3-10B-Instruct 78.0% Falcon3 परिवार ने बेहतर विज्ञान, गणित और कोड क्षमताओं के साथ पांच ओपन मॉडल जारी किए
2024-12-17 Falcon3-1B-Instruct 54.4% Falcon3 परिवार ने बेहतर विज्ञान, गणित और कोड क्षमताओं के साथ पांच ओपन मॉडल जारी किए