أعلن مطوّر غراند كودر عن تقييمات تاريخية داخلية تهدف إلى مساعدة نماذج الذكاء الاصطناعي القوية على التفكير والعمل بجهد أكبر، بدلاً من جعل النموذج نفسه أكثر ذكاءً. أجريت دراسة هندسية متدرجة شغّلت في البداية 96 تنفيذًا معزولاً، لكنها استبعدت عائلتي مهام بسبب متطلبات خفية غير صالحة، تاركًا 72 تشغيلًا للتحليل.
- نجح الأساس في 13 من أصل 18 مهمة، بينما نجحت ثلاث تكوينات لـ Grand Coder في 16/18 و16/18 و15/18 على التوالي.
- تركزت المكاسب في عائلتي مهام محتفظ بهما، بينما كانت العائلات الأربع الأخرى ناجحة بالفعل في كل الظروف.
- أظهرت تقييمات أخرى اختبارات مشبعة دون فروق أو انتصارات ظاهرية تلاشت بعد تصحيحات الدرجات.
- تحسنت درجات المراجعة العمياء في دراسة بناء واحدة، لكن الاختبارات السلوكية المصححة لم تُظهر أي ميزة رغم التكلفة الأعلى.
يخلص المؤلف إلى أن غراند كودر قد أنتفعت محددة وقابلة للقياس مفيدة للعمل الجاري، مشددًا على ضرورة فصل انطباعات المراجعين عن الفحوصات السلوكية الفعلية والتكاليف. يبقى التنفيذ خاصًا، مما يحد من التحقق المستقل من هذه النتائج.