Benchmark · reasoning

ARC-AGI 3

12 نتائج 7 نماذج

ARC Prize's third generation (2026): the agent must learn an unseen interactive game environment from scratch. Scores run far lower than — and are NOT comparable to — the static grid-puzzle ARC-AGI 1/2.

0 25 50 75 100 2026-07-17 2026-08-12 2026-09-07 Schema · 99 · 2026-07-17 Claude Opus 5 · 30.2 · 2026-07-31 GPT‑5.6 Sol · 38.3 · 2026-07-31 GPT‑5.6 Sol · 38.3 · 2026-08-13 Prime Agent · 95.5 · 2026-08-06 Prime Agent · 95.5 · 2026-08-25 Prime Agent · 95.5 · 2026-08-25 GPT-6 Astra · 99.9 · 2026-09-04 GPT-6 Astra · 62.7 · 2026-09-04 Nvidia AVO · 100 · 2026-09-04 GPT‑6 Astra · 99.9 · 2026-09-05 GPT‑6 Astra · 99.9 · 2026-09-07
Schema Claude Opus 5 GPT‑5.6 Sol Prime Agent GPT-6 Astra Nvidia AVO GPT‑6 Astra
الجدول الزمني
التاريخ النموذج النتيجة المصدر
2026-09-07 GPT‑6 Astra 99.9% كلود يثبت المبرهنة الأخيرة لفيرما، وتخطط أوبن إيه آي لأتمتة الباحث
2026-09-05 GPT‑6 Astra 99.9% OpenAI تطلق GPT-6 Astra بقدرات محسّنة للاستخدام الحاسوبي والبرمجة وأمن السيبراني
2026-09-04 GPT-6 Astra 62.7% إنفيديا تستحوذ على Hugging Face؛ أوبن إيه آي تطلق GPT-6 Astra؛ مايكروسوفت تطلق MAI-Transcribe-2
2026-09-04 Nvidia AVO 100.0% إنفيديا تحقق 100% على ARC AGI-3 باستخدام أداة AVO
2026-09-04 GPT-6 Astra 99.9% OpenAI تُطلق GPT-6 Astra، نموذج لاستخدام الحاسوب بسياق يتكون من 1.05M رمز
2026-08-25 Prime Agent 95.5% Prime Agent: إطار عمل RLM ذاتي التحسين يرفع دقة ARC-AGI-3 RHAE Best@1 إلى 95.5%
2026-08-25 Prime Agent 95.5% Prime Agent: إطار RLM ذاتي التحسين يرفع ARC-AGI-3 RHAE Best@1 إلى 95.5%
2026-08-13 GPT‑5.6 Sol 38.3% OpenAI تطلق GPT-5.6 لسير عمل وكيلي فعال من حيث التكلفة وعالي الأداء
2026-08-06 Prime Agent 95.5% PrimeInteltech تطلق Prime Agent، إطار عمل برمجة ذاتي التحسين
2026-07-31 GPT‑5.6 Sol 38.3% OpenAI تخفض سعر GPT-5.6 Luna بنسبة 80 في المئة
2026-07-31 Claude Opus 5 30.2% أنثروبيك تطلق كلاود أوبوس 5؛ نماذج أوبن إيه آي تخترق هاجينغ فيس أثناء اختبار الأمان
2026-07-17 Schema 99.0% مونشوت تطلق Kimi K3؛ Schema harness يحقق 99% على ARC-AGI 3