ख़बरों में उल्लिखित सभी बेंचमार्क — सबसे चर्चित से लेकर विशिष्ट तक।
| # | बेंचमार्क | प्रकार | अग्रणी | मॉडल | उल्लेख |
|---|---|---|---|---|---|
| 01 | SWE-bench Verified | agentic | 96% Claude Opus 5 | 42 | 52 |
| 02 | GPQA Diamond | reasoning | 94.9% Grok 4.6 | 45 | 44 |
| 03 | Terminal-Bench 2 | agentic | 94% agents | 25 | 34 |
| 04 | Humanity's Last Exam | reasoning | 60% DeepSeek-V4-Pro | 22 | 28 |
| 05 | AIME 2025 | math | 100% Claude Sonnet 4.5 | 27 | 24 |
| 06 | OSWorld | agentic | 90.69% Opus 5 | 22 | 23 |
| 07 | ARC-AGI 2 | reasoning | 97.9% Confluence Lab | 28 | 22 |
| 08 | AIME 2024 | math | 96.7% o3 | 25 | 22 |
| 09 | BrowseComp | agentic | 92.2% GPT-5.6 Sol | 22 | 20 |
| 10 | LiveCodeBench | coding | 86.4% Step 3.5 Flash | 19 | 20 |
| 11 | Aider Polyglot | coding | 88% GPT‑5 | 23 | 19 |
| 12 | ARC-AGI 1 | reasoning | 93% Opus 4.6 | 23 | 17 |
| 13 | SWE-bench Pro | agentic | 78% Argus | 12 | 17 |
| 14 | τ²-bench | agentic | 98.7% GPT-5.2 Thinking | 13 | 17 |
| 15 | DeepSWE | agentic | 88.5% DeepSeek V4 Pro 0813 | 16 | 16 |
| 16 | LMSYS Arena (Elo) | general | 1760 Claude Fable 5 | 21 | 15 |
| 17 | Terminal-Bench | agentic | 91.9% GPT-5.6 Sol (ultra mode) | 17 | 14 |
| 18 | FrontierMath | math | 51.7% GPT-5.5 | 14 | 14 |
| 19 | MATH-500 | math | 98.2% GLM-4.5 | 17 | 12 |
| 20 | GAIA | agentic | 86.5% Manus AI | 13 | 12 |
| 21 | MMMU-Pro | multimodal | 84% Gemini 2.5 Pro Deep Think | 8 | 11 |
| 22 | Codeforces (Elo) | coding | 3455 Gemini 3 Deep Think | 10 | 9 |
| 23 | MMLU | general | 90% Gemini Ultra | 8 | 9 |
| 24 | WebArena | agentic | 73.6% Qwen-UI-Agent | 9 | 9 |
| 25 | GSM8K | math | 97.1% DUP method | 9 | 8 |
| 26 | GDPval-AA (Elo) | agentic | 1769 GLM-5.3 | 6 | 8 |
| 27 | SWE-bench Multilingual | agentic | 79.6% Ornith-1.5 | 6 | 8 |
| 28 | Artificial Analysis Intelligence Index | general | 61% Grok 4.6 | 10 | 7 |
| 29 | MMLU-Pro | general | 90.4% Claude 3.5 Sonnet | 10 | 7 |
| 30 | SWE-bench | agentic | 80.9% Claude Opus 4.5 | 7 | 7 |
| 31 | IFEval | general | 95.9% GPT-5 | 8 | 7 |
| 32 | ARC-AGI 3 | reasoning | 99% Schema | 4 | 7 |
| 33 | HumanEval | coding | 92% Claude 3.5 Sonnet | 5 | 6 |
| 34 | Android World | agentic | 87.1% Surfer 2 | 6 | 5 |
| 35 | Berkeley Function-Calling Leaderboard | agentic | 90.6% GLM-4.5 | 5 | 5 |
| 36 | CharXiv | multimodal | 95.2% Claude 3.5 Sonnet | 5 | 5 |
| 37 | MathVista | multimodal | 84.3% o4-mini | 5 | 5 |
| 38 | MMMU | multimodal | 84.2% GPT-5 | 4 | 5 |
| 39 | HealthBench | general | 51.9% VITA | 6 | 4 |
| 40 | BIG-Bench Hard | reasoning | 93.1% Claude 3.5 Sonnet | 4 | 4 |
| 41 | MLE-bench | agentic | 71.21% Frontis-MA1 (35B) | 2 | 4 |
| 42 | Video-MME | multimodal | 94.7% Claude 3.5 Sonnet | 3 | 4 |
| 43 | OSWorld 2.0 | agentic | 70% Claude Opus 5 | 3 | 3 |
| 44 | Code Arena (Elo) | coding | 1588 Gemini 3.7 Flash | 2 | 3 |
| 45 | MBPP | coding | 73.8% Falcon3-10B-Base | 3 | 3 |
| 46 | SimpleQA | general | 62.5% GPT-4.5 | 3 | 3 |
| 47 | SWE-rebench | agentic | 56.5% Claude Opus 4.8 xhigh | 12 | 2 |
| 48 | CursorBench | agentic | 70% Claude Opus 5 | 2 | 2 |
| 49 | PutnamBench | math | 587 Leanstral 1.5 | 1 | 2 |
| 50 | VisualWebArena | agentic | 87% CUA | 2 | 2 |
| 51 | JailbreakBench | safety | 93% STEER (applied to six open-source 8B-parameter models) | 2 | 1 |
| 52 | Commit-0 | coding | 56.8 Agents-A1 | 1 | 1 |
| 53 | DROP | reasoning | 87.1% Claude 3.5 Sonnet | 1 | 1 |
| 54 | GDPval | agentic | 34% Gemini 3.7 Flash | 1 | 1 |
| 55 | HumanEval+ | coding | 13% Qwen3.5-4B | 1 | 1 |
| 56 | IMO-AnswerBench | math | 100% Claude Opus 5 | 1 | 1 |
| 57 | MRCR | general | 70.5% Gemini 2.0 Flash | 1 | 1 |
| 58 | Multi-SWE-bench | agentic | 32.03% Qwen3.5-27B | 1 | 1 |
| 59 | SWE-Lancer | agentic | 32.6% GPT-4.5 | 1 | 1 |
| 60 | Vending-Bench | agentic | 4694.15 Grok 4 | 1 | 1 |
| 61 | Windows Agent Arena | agentic | 50.6% UI-TARS-2 | 1 | 1 |