الاختبارات المرجعية

كل الاختبارات المرجعية المذكورة في الأخبار — من الأكثر تداولاً إلى المتخصصة.

# الاختبار النوع المتصدر النماذج الإشارات
01 SWE-bench Verified agentic 96% Claude Opus 5 42 52
02 GPQA Diamond reasoning 94.9% Grok 4.6 45 44
03 Terminal-Bench 2 agentic 94% agents 25 34
04 Humanity's Last Exam reasoning 60% DeepSeek-V4-Pro 22 28
05 AIME 2025 math 100% Claude Sonnet 4.5 27 24
06 OSWorld agentic 90.69% Opus 5 22 23
07 ARC-AGI 2 reasoning 97.9% Confluence Lab 28 22
08 AIME 2024 math 96.7% o3 25 22
09 BrowseComp agentic 92.2% GPT-5.6 Sol 22 20
10 LiveCodeBench coding 86.4% Step 3.5 Flash 19 20
11 Aider Polyglot coding 88% GPT‑5 23 19
12 ARC-AGI 1 reasoning 93% Opus 4.6 23 17
13 SWE-bench Pro agentic 78% Argus 12 17
14 τ²-bench agentic 98.7% GPT-5.2 Thinking 13 17
15 DeepSWE agentic 88.5% DeepSeek V4 Pro 0813 16 16
16 LMSYS Arena (Elo) general 1760 Claude Fable 5 21 15
17 Terminal-Bench agentic 91.9% GPT-5.6 Sol (ultra mode) 17 14
18 FrontierMath math 51.7% GPT-5.5 14 14
19 MATH-500 math 98.2% GLM-4.5 17 12
20 GAIA agentic 86.5% Manus AI 13 12
21 MMMU-Pro multimodal 84% Gemini 2.5 Pro Deep Think 8 11
22 Codeforces (Elo) coding 3455 Gemini 3 Deep Think 10 9
23 MMLU general 90% Gemini Ultra 8 9
24 WebArena agentic 73.6% Qwen-UI-Agent 9 9
25 GSM8K math 97.1% DUP method 9 8
26 GDPval-AA (Elo) agentic 1769 GLM-5.3 6 8
27 SWE-bench Multilingual agentic 79.6% Ornith-1.5 6 8
28 Artificial Analysis Intelligence Index general 61% Grok 4.6 10 7
29 MMLU-Pro general 90.4% Claude 3.5 Sonnet 10 7
30 SWE-bench agentic 80.9% Claude Opus 4.5 7 7
31 IFEval general 95.9% GPT-5 8 7
32 ARC-AGI 3 reasoning 99% Schema 4 7
33 HumanEval coding 92% Claude 3.5 Sonnet 5 6
34 Android World agentic 87.1% Surfer 2 6 5
35 Berkeley Function-Calling Leaderboard agentic 90.6% GLM-4.5 5 5
36 CharXiv multimodal 95.2% Claude 3.5 Sonnet 5 5
37 MathVista multimodal 84.3% o4-mini 5 5
38 MMMU multimodal 84.2% GPT-5 4 5
39 HealthBench general 51.9% VITA 6 4
40 BIG-Bench Hard reasoning 93.1% Claude 3.5 Sonnet 4 4
41 MLE-bench agentic 71.21% Frontis-MA1 (35B) 2 4
42 Video-MME multimodal 94.7% Claude 3.5 Sonnet 3 4
43 OSWorld 2.0 agentic 70% Claude Opus 5 3 3
44 Code Arena (Elo) coding 1588 Gemini 3.7 Flash 2 3
45 MBPP coding 73.8% Falcon3-10B-Base 3 3
46 SimpleQA general 62.5% GPT-4.5 3 3
47 SWE-rebench agentic 56.5% Claude Opus 4.8 xhigh 12 2
48 CursorBench agentic 70% Claude Opus 5 2 2
49 PutnamBench math 587 Leanstral 1.5 1 2
50 VisualWebArena agentic 87% CUA 2 2
51 JailbreakBench safety 93% STEER (applied to six open-source 8B-parameter models) 2 1
52 Commit-0 coding 56.8 Agents-A1 1 1
53 DROP reasoning 87.1% Claude 3.5 Sonnet 1 1
54 GDPval agentic 34% Gemini 3.7 Flash 1 1
55 HumanEval+ coding 13% Qwen3.5-4B 1 1
56 IMO-AnswerBench math 100% Claude Opus 5 1 1
57 MRCR general 70.5% Gemini 2.0 Flash 1 1
58 Multi-SWE-bench agentic 32.03% Qwen3.5-27B 1 1
59 SWE-Lancer agentic 32.6% GPT-4.5 1 1
60 Vending-Bench agentic 4694.15 Grok 4 1 1
61 Windows Agent Arena agentic 50.6% UI-TARS-2 1 1