Benchmark · general
IFEval
IFEval (Instruction-Following Eval) यह मापता है कि कोई भाषा मॉडल प्रॉम्प्ट में दिए गए स्पष्ट, मशीन द्वारा जाँचे जा सकने वाले फ़ॉर्मैट और बाध्यता संबंधी निर्देशों — जैसे लंबाई या फ़ॉर्मैट के नियम — का कितनी विश्वसनीयता से पालन करता है। स्कोर ऐसे जाँचने-योग्य निर्देशों का वह प्रतिशत है जिन्हें मॉडल वास्तव में पूरा करता है।
और पढ़ें
- उदाहरण
- जैसे कोई प्रॉम्प्ट «ठीक 3 बुलेट पॉइंट में सारांश लिखो और एक भी अल्पविराम इस्तेमाल मत करो» — मॉडल को ऐसा उत्तर देना होगा जो हर दी गई बाध्यता को पूरा करे।
- स्कोरिंग
- हर उत्तर को उसकी जाँचने-योग्य बाध्यताओं (बुलेट की संख्या, शब्दों की संख्या, वर्जित अक्षर, अनिवार्य कीवर्ड, बड़े/छोटे अक्षर आदि) के विरुद्ध स्वचालित रूप से परखा जाता है, और स्कोर पूरी हुई बाध्यताओं का प्रतिशत होता है, जिसे निर्देश-स्तर और पूरे प्रॉम्प्ट-स्तर (प्रॉम्प्ट की सभी बाध्यताएँ पूरी) दोनों पर बताया जाता है।
- सत्यापन
- सत्यापन पूरी तरह स्वचालित है: एक छोटा नियतात्मक प्रोग्राम हर बाध्यता को जाँचता है (उदाहरण के लिए, बुलेट गिनना या अल्पविराम ढूँढना), इसलिए इसमें कोई मानवीय निर्णय या किसी अन्य LLM द्वारा मूल्यांकन शामिल नहीं होता।
- यह क्यों मायने रखता है
- यह इस बात को अलग कर देता है कि मॉडल सटीक निर्देशों का पालन कर सकता है या नहीं, बनाम उसका उत्तर तथ्यात्मक रूप से सही है या नहीं; यह मायने रखता है क्योंकि फ़ॉर्मैट और बाध्यताओं का विश्वसनीय पालन ही मॉडलों को असली ऐप्लिकेशन और स्वचालित पाइपलाइनों में उपयोगी बनाता है।
हल किया गया उदाहरण
कार्य
घर से काम करते समय उत्पादक बने रहने के बारे में एक छोटी सलाह ठीक दो अनुच्छेदों में लिखें। पूरा उत्तर केवल lowercase अक्षरों में लिखें (बड़े अक्षर की अनुमति नहीं है) और कहीं भी कोई अल्पविराम (comma) का उपयोग न करें। उत्तर को ठीक इस वाक्यांश के साथ समाप्त करें: 'that is all.'
समाधान
working from home rewards a bit of structure so pick three goals each morning and give every goal its own block of time on your calendar. put your phone in another room and take a short walk between blocks to reset your attention.
a clear desk and a fixed start time help your brain shift into work mode fast. stop at a set hour and celebrate one finished task so you never drift toward burnout. that is all.
व्याख्या
उत्तर हर सत्यापन-योग्य बाधा का पालन करता है: ठीक दो अनुच्छेद, कोई बड़ा अक्षर नहीं, शून्य अल्पविराम, और सटीक अंतिम वाक्यांश। IFEval प्रत्येक निर्देश को एक नियतात्मक (deterministic) Python सत्यापक से जाँचता है और निर्देश-स्तर तथा पूरे prompt-स्तर दोनों पर strict/loose सटीकता बताता है (कोई prompt तभी गिना जाता है जब उसके सभी निर्देश पास हों)।
| तारीख़ | मॉडल | स्कोर | स्रोत |
|---|---|---|---|
| 2026-08-13 | LFM2.5-VL-3B | 82.3% | Liquid AI ने LFM2.5-VL-3B जारी किया, जो टूल कॉलिंग के साथ एक 3B ऑन-डिवाइज विजन-लैंग्वेज मॉडल है |
| 2026-07-06 | Agents-A1 | 80.6pts | पैरामीटर नहीं, क्षितिज को स्केल करें: एक 35B एजेंट के साथ ट्रिलियन-पैरामीटर प्रदर्शन प्राप्त करना |
| 2025-12-15 | GPT-5 | 95.9% | त्सिंगह्वा और एंट ग्रुप को पता चला कि सूक्ष्म प्रॉम्प्ट्स पर एलएलएम निर्देश-अनुपालन विश्वसनीयता 61.8% तक गिर जाती है |
| 2025-04-14 | GPT-4.1 | 87.4% | OpenAI ने GPT-4.1 परिवार को 1M टोकन संदर्भ और कोडिंग सुधारों के साथ जारी किया |
| 2025-02-24 | Claude 3.7 Sonnet | 93.2% | Anthropic ने Claude 3.7 Sonnet को गतिशील तर्क नियंत्रण के साथ जारी किया |
| 2024-12-17 | Falcon3-10B-Instruct | 78.0% | Falcon3 परिवार ने बेहतर विज्ञान, गणित और कोड क्षमताओं के साथ पांच ओपन मॉडल जारी किए |
| 2024-12-17 | Falcon3-1B-Instruct | 54.4% | Falcon3 परिवार ने बेहतर विज्ञान, गणित और कोड क्षमताओं के साथ पांच ओपन मॉडल जारी किए |