| 2026-09-29 |
Gemini 3.5 Flash |
79.0% |
أبحاث جوجل تطلق RRSI لمنع الإفراط في التخصيص لحيازة وكلاء الذكاء الاصطناعي
|
| 2026-09-29 |
Qwen3.8-Flash-Next Coder |
75.6% |
إصدار ISTA لنماذج GSQ-RCO GGUF الخاصة بـ Qwen3.8-Flash-Next وإصدار Coder المقتطع بنسبة 50% من الخبراء
|
| 2026-09-29 |
Qwen3.5-4B (with ROFT) |
49.2% |
يحسّن ROFT النماذج الوكيلية عن طريق الضبط الدقيق على الشروحات المولَّدة ذاتياً
|
| 2026-09-28 |
Ember-1 |
92.2% |
Fireworks AI تطلق Ember-1، نموذجاً مُدرَّباً بعد التدريب على Kimi K3 باستخدام 40% أقل من الرموز
|
| 2026-09-09 |
Qwen Test agent + Repair agent (post-trained) |
72.6% |
يستخدم ExecCritic تعزيز التعلم المعتمد على الأدوار لتحسين وكلاء البرمجة عبر الإصلاح الموجه بالاختبارات
|
| 2026-09-09 |
Qwen Test agent (post-trained) |
62.2% |
يستخدم ExecCritic تعزيز التعلم المعتمد على الأدوار لتحسين وكلاء البرمجة عبر الإصلاح الموجه بالاختبارات
|
| 2026-09-09 |
GPT-5.6-sol (Test agent) |
65.3% |
يستخدم ExecCritic تعزيز التعلم المعتمد على الأدوار لتحسين وكلاء البرمجة عبر الإصلاح الموجه بالاختبارات
|
| 2026-09-09 |
base Test agent (no-test baseline) |
57.3% |
يستخدم ExecCritic تعزيز التعلم المعتمد على الأدوار لتحسين وكلاء البرمجة عبر الإصلاح الموجه بالاختبارات
|
| 2026-09-09 |
base Repair agent (no-test baseline) |
61.2% |
يستخدم ExecCritic تعزيز التعلم المعتمد على الأدوار لتحسين وكلاء البرمجة عبر الإصلاح الموجه بالاختبارات
|
| 2026-09-09 |
Qwen Test agent (post-trained) + Repair agent (post-trained) |
72.6% |
يستخدم ExecCritic تعزيز التعلم المحدد للدور لتحسين وكلاء البرمجة عبر الإصلاح الموجه بالاختبارات
|
| 2026-09-09 |
Qwen Test agent (post-trained) |
62.2% |
يستخدم ExecCritic تعزيز التعلم المحدد للدور لتحسين وكلاء البرمجة عبر الإصلاح الموجه بالاختبارات
|
| 2026-09-09 |
GPT-5.6-sol (Test agent) |
65.3% |
يستخدم ExecCritic تعزيز التعلم المحدد للدور لتحسين وكلاء البرمجة عبر الإصلاح الموجه بالاختبارات
|
| 2026-09-09 |
base Repair agent (no-test baseline) |
61.2% |
يستخدم ExecCritic تعزيز التعلم المحدد للدور لتحسين وكلاء البرمجة عبر الإصلاح الموجه بالاختبارات
|
| 2026-09-09 |
base Test agent |
57.3% |
يستخدم ExecCritic تعزيز التعلم المحدد للدور لتحسين وكلاء البرمجة عبر الإصلاح الموجه بالاختبارات
|
| 2026-09-07 |
K2-Horizon-7B |
70.6% |
IFM تُصدر K2 Horizon: ستة نماذج Apache 2.0 من 0.9B إلى 375B
|
| 2026-09-07 |
K2-Horizon-3.7B |
68.6% |
IFM تُصدر K2 Horizon: ستة نماذج Apache 2.0 من 0.9B إلى 375B
|
| 2026-09-02 |
Qwen3.5-9B |
16.6% |
CANOPY تمكّن Qwen3-14B من تصدر قائمة AppWorld باستخدام التعزيز المعتمد على النتائج فقط
|
| 2026-08-26 |
Granite 4.2 30B |
57.0% |
إصدار غرانيت 4.2 من آي بي إم مع الاستدلال الأصلي والتعلم المعزز الوكيل للنماذج المؤسسية المفتوحة
|
| 2026-08-26 |
Granite 4.2 8B |
47.67% |
إصدار غرانيت 4.2 من آي بي إم مع الاستدلال الأصلي والتعلم المعزز الوكيل للنماذج المؤسسية المفتوحة
|
| 2026-08-20 |
Qwen3.5-9B |
14.6% |
إطلاق ميتا لموديل ميوز فيديو مع صوت أصلي؛ سترايب تستحوذ على أوبن رويتر
|
| 2026-08-20 |
Ornith-1.5 |
86.0% |
Z.ai تقترح قانون قياس ما بعد التدريب وتطلق GLM 5.3؛ Ornith-1.5 ينطلق مع تحسين ذاتي
|
| 2026-08-19 |
Ornith-1.5 |
86.0% |
إطلاق Ornith-1.5 لنماذج بحجم 9B و35B-A3B و397B بتدريب ذاتي التحسين
|
| 2026-08-18 |
Qwen3.5-27B |
74.8% |
وكيل كوتشي يحل 374 حالة من SWE-bench Verified باستخدام Qwen3.5-27B
|
| 2026-08-10 |
Qwen3.6-27B |
77.2% |
إطلاق ميتا لـ Muse Glimmer، نموذج وكيل بوزن مفتوح يتكون من 30 مليار معلمة ويعمل على بطاقة رسوميات استهلاكية واحدة
|
| 2026-08-03 |
Orchard-SWE |
69.7% |
أبحاث مايكروسوفت تطلق إطار عمل Orchard للذكاء الاصطناعي الوكيل القابل للتوسع
|
| 2026-08-03 |
Inkling-Small |
80.2% |
مختبر الآلات المفكرة يُصدر Inkling-Small، وهو نموذج MoE متعدد الوسائط بوزن مفتوح يتكون من 276 مليار معلمة
|
| 2026-07-24 |
Claude Opus 5 |
96.0% |
أنثروبيك تطلق كلود أوبوس 5 مع التفكير الافتراضي وتحسينات البرمجة الوكيلية
|
| 2026-07-19 |
DeepSeek V4 Pro |
80.6% |
مقارنة بين Kimi K3 وDeepSeek V4 Pro وGLM-5.2 من حيث المقاييس، الترخيص، وتكلفة التشغيل
|
| 2026-07-17 |
Devstral 2 |
72.2% |
مسترال فايب للكود يقود أربعة وكلاء برمجة في مهمة من الهيكل إلى طلب السحب
|
| 2026-07-17 |
Devstral Small 2 |
68.0% |
مسترال فايب للكود يقود أربعة وكلاء برمجة في مهمة من الهيكل إلى طلب السحب
|
| 2026-07-14 |
Qwen3.5-35B-A3B |
6.0% |
إعادة ضبط UMoE لمجموعات خبراء MoE لتحسين الضبط الدقيق الخاص بالقطاع
|
| 2026-07-14 |
Qwen3-30B-A3B |
6.0% |
إعادة ضبط UMoE لمجموعات خبراء MoE لتحسين الضبط الدقيق الخاص بالقطاع
|
| 2026-07-07 |
LLM-as-a-Verifier |
78.2% |
LLM-as-a-Verifier يقدم إطار عمل تحقق عام مع تقييم مستمر
|
| 2026-04-25 |
Qwen3.6-27B |
77.2% |
أليبا تطلق Qwen3.6-27B، متفوقةً على سلفها الأكبر في معايير الترميز
|
| 2026-04-24 |
V4-Pro-Max |
80.6% |
ديب سيك تطلق الإصدار الرابع بهندسة سياق طويل فعّالة للوكلاء
|
| 2026-03-25 |
o3 |
71.7% |
OpenAI تعلن عن تقاعد نموذج o3 من ChatGPT وتشارك نتائج الاختبارات المرجعية
|
| 2026-02-17 |
Claude Sonnet 4.6 |
79.6% |
أنثروبيك تطلق كلاود سونيت 4.6 مع تحسينات في البرمجة واستخدام الكمبيوتر وسياق يتكون من مليون توكن
|
| 2026-02-05 |
Claude Opus 4.6 |
80.8% |
أنثروبيك تطلق كلاود أوبوس 4.6 بنافذة سياق بـ 1 مليون وتطبيقات عميلية محسّنة
|
| 2026-02-01 |
Claude Opus 4.6 |
80.8% |
تكشف المقاييس المعقمة عن فجوة نقطية 12 بين نماذج البرمجة بالذكاء الاصطناعي الرائدة
|
| 2026-02-01 |
MiniMax M2.5 |
80.2% |
تكشف المقاييس المعقمة عن فجوة نقطية 12 بين نماذج البرمجة بالذكاء الاصطناعي الرائدة
|
| 2026-01-28 |
Qwen3.6-27B |
77.2% |
Qwen 3.6-27B وDeepSeek V4 Flash يتصدران معايير الترميز المحلي
|
| 2025-12-11 |
GPT-5.2 Thinking |
80.0% |
OpenAI تطلق GPT-5.2، متفوقة على Gemini 3 في معايير البرمجة والاستدلال
|
| 2025-12-11 |
GPT-5.2 Thinking |
80.0% |
OpenAI تطرح GPT-5.2 بقدرات عمل معرفي احترافي متقدمة
|
| 2025-12-09 |
Devstral 2 |
72.2% |
Mistral تطلق نماذج Devstral 2 للبرمجة وواجهة سطر الأوامر Mistral Vibe CLI
|
| 2025-12-09 |
Devstral Small 2 |
68.0% |
Mistral تطلق نماذج Devstral 2 للبرمجة وواجهة سطر الأوامر Mistral Vibe CLI
|
| 2025-11-19 |
GPT-5.1-Codex-Max |
77.9% |
OpenAI تجعل GPT-5.1-Codex-Max الافتراضي في Codex CLI
|
| 2025-11-19 |
Kimi K2 Thinking |
71.3% |
Moonshot AI تطلق Kimi K2 Thinking مع استخدام الأدوات الوكيلية
|
| 2025-11-07 |
Kimi K2 Thinking |
71.3% |
Moonshot AI تطلق Kimi K2 Thinking، نموذج استدلال مفتوح المصدر بـ 1T معلمة
|
| 2025-09-30 |
Claude Sonnet 4.5 |
77.2% |
أنثروبيك تطلق كلود سونيت 4.5 بقدرات برمجة ووكيل محسّنة
|
| 2025-09-29 |
Claude Sonnet 4.5 |
77.2% |
Anthropic
|
| 2025-08-07 |
GPT-5 |
74.9% |
OpenAI تطلق GPT-5 الموحّد مع التوجيه في الوقت الفعلي ووصول مجاني
|
| 2025-08-07 |
GPT‑5 |
74.9% |
OpenAI تطلق واجهة برمجة تطبيقات GPT-5 بتحسينات في البرمجة والوكلاء
|
| 2025-08-07 |
GPT-5 |
74.9% |
OpenAI تطرح GPT-5 بتوجيه موحد واستدلال على مستوى الخبراء
|
| 2025-08-07 |
GPT-5 |
74.9% |
أوبن إيه آي تطلق جي بي تي-5 بمنطق تكيفي وهندسة معمارية موحدة
|
| 2025-08-07 |
GPT-5 |
74.9% |
OpenAI
|
| 2025-08-06 |
GLM-4.5 |
64.2% |
تشيبو آي تطلق نماذج GLM-4.5 التي توازي كلود وديبسيك
|
| 2025-07-28 |
Kimi K2 |
65.8% |
مونشوت تطلق Kimi K2، نموذج MoE مفتوح المصدر للوكلاء بـ 32 مليار معلمة نشطة
|
| 2025-07-28 |
Kimi K2 |
65.8% |
كيمي K2: نموذج MoE مفتوح المصدر يحتوي على 1T معلمة ومُحسّن MuonClip
|
| 2025-07-11 |
Kimi K2-Instruct |
65.8% |
Moonshot AI تطلق Kimi-K2-Instruct، نموذج MoE بـ 1 تريليون معلمة مع قدرات وكيلة
|
| 2025-07-11 |
Kimi K2 |
65.8% |
Moonshot AI تطلق Kimi K2، نموذج MoE بـ 1T معلمة مع قدرات وكيلية
|
| 2025-07-10 |
Devstral Medium |
61.6% |
Mistral AI تطلق Devstral Small 1.1 وDevstral Medium بالتعاون مع All Hands AI
|
| 2025-07-10 |
Devstral Small 1.1 |
53.6% |
Mistral AI تطلق Devstral Small 1.1 وDevstral Medium بالتعاون مع All Hands AI
|
| 2025-05-30 |
Deepseek-R1-0528 |
57.6% |
ديب سيك تُحدّث نموذج R1 بتحسينات في الاستدلال ونتائج الاختبارات
|
| 2025-05-23 |
Claude Sonnet 4 |
72.7% |
أنثروبيك تطلق كلاود أوبس 4 وسونيت 4 بقدرة التفكير الهجين
|
| 2025-05-23 |
Claude Opus 4 |
72.5% |
أنثروبيك تطلق كلاود أوبس 4 وسونيت 4 بقدرة التفكير الهجين
|
| 2025-05-22 |
Claude Opus 4 |
72.5% |
Anthropic
|
| 2025-05-21 |
Devstral |
46.8% |
Mistral AI تُطلق نموذج Devstral اللغوي الكبير الوكيلية لهندسة البرمجيات
|
| 2025-04-17 |
o4-mini |
68.1% |
OpenAI تُطلق o4-mini، نموذج استدلالي متعدد الوسائط أسرع وأرخص
|
| 2025-04-16 |
OpenAI o3 |
71.7% |
OpenAI
|
| 2025-04-14 |
GPT-4.1 |
54.6% |
OpenAI تطلق عائلة GPT-4.1 مع سياق يتكون من مليون توكن وتحسينات في البرمجة
|
| 2025-04-14 |
GPT‑4.1 |
54.6% |
OpenAI تُطلق GPT-4.1 وGPT-4.1 mini وGPT-4.1 nano عبر واجهة برمجة التطبيقات
|
| 2025-03-26 |
Gemini 2.5 Pro |
63.8% |
جوجل تطلق نموذج التفكير التجريبي Gemini 2.5 Pro بسياق يتكون من مليون رمز
|
| 2025-03-25 |
Gemini 2.5 Pro |
63.8% |
جوجل تقدم النموذج التجريبي Gemini 2.5 Pro
|
| 2025-03-25 |
Gemini 2.5 Pro |
63.8% |
جوجل تطرح نموذج التفكير جيمينى 2.5 برو
|
| 2025-03-25 |
Gemini 2.5 Pro |
63.8% |
Google DeepMind
|
| 2025-03-05 |
GPT-4.5 |
38.0% |
OpenAI تطلق GPT-4.5، أكبر نموذج لها، لـ ChatGPT Plus
|
| 2025-02-24 |
Claude 3.7 Sonnet |
62.3% |
Anthropic
|
| 2025-01-06 |
Claude 3.5 Sonnet |
49.0% |
Claude 3.5 Sonnet يحقق 49% على SWE-bench Verified
|
| 2024-12-20 |
o3 |
71.7% |
OpenAI تطلق نموذج o3 بأداء عالٍ في الاستدلال والبرمجة
|
| 2024-12-20 |
o3 |
71.7% |
OpenAI تستعرض نموذج o3 للاستدلال مع إنجازات في ARC AGI و Frontier Math
|
| 2024-10-30 |
Claude 3.5 Sonnet |
49.0% |
حقق Claude 3.5 Sonnet نتيجة بنسبة 49% على SWE-bench Verified مع الحد الأدنى من الهيكل المساعد
|
| 2024-10-22 |
Claude 3.5 Sonnet |
49.0% |
أنثروبيك ترقّي نموذج كلاود 3.5 سونيت، وتطلق كلاود 3.5 هايكو وإصدار بيتا لخاصية "استخدام الحاسوب"
|
| 2024-10-22 |
Claude 3.5 Haiku |
40.6% |
أنثروبيك ترقّي نموذج كلاود 3.5 سونيت، وتطلق كلاود 3.5 هايكو وإصدار بيتا لخاصية "استخدام الحاسوب"
|
| 2024-10-22 |
Claude 3.5 Sonnet |
49.0% |
Anthropic
|
| 2024-08-13 |
Agentless |
32.0% |
OpenAI تطلق مجموعة SWE-bench Verified الفرعية المُتحقق منها من قبل البشر
|
| 2024-08-13 |
GPT‑4o |
33.2% |
OpenAI تطلق مجموعة SWE-bench Verified الفرعية المُتحقق منها من قبل البشر
|