أصدرت OpenAI نماذج o1-preview و o1-mini، وهي مدربة لمحاكاة التفكير من خلال توليد وتحسين رموز الاستدلال قبل تقديم إجابة نهائية. تُظهر الاختبارات على مجموعة بيانات التقييم العامة ARC-AGI أن كلا المتغيرين من o1 يتفوقان على GPT-4o في الدقة.
- يحقق o1-preview دقة مماثلة لـ Claude 3.5 Sonnet الخاص بـ Anthropic لكنه يستغرق حوالي 10 أضعاف الوقت لإكمال المهام.
- استغرق حل المهام العامة الـ 400 في ARC-AGI من o1 مدة 70 ساعة، مقارنة بدقيقة واحدة فقط مدتها 30 دقيقة لـ GPT-4o و Claude 3.5 Sonnet.
- تستخدم النماذج نموذج سلسلة التفكير المطبق أثناء التدريب والاستدلال، مستفيدةً من التعلم المعزز لتحسين الاستراتيجيات.
- تتناسب الأداء مع حسابات وقت الاختبار، مما يُظهر علاقة لوغاريتمية خطية بين الدقة وكمية رموز الاستدلال المستخدمة.
تُبرز النتائج أنه بينما تحسّن حسابات وقت الاختبار الزائدة الدقة، تظل الكفاءة عاملاً حاسماً للتطبيق العملي والتقييم المعياري.