طور الباحثون خط أنابيب ما بعد التدريب لنماذج اللغة الكبيرة يمكّنها من تحقيق أداء بحصول على الميدالية الذهبية في البرمجة التنافسية. ومن خلال الجمع بين الضبط الدقيق الخاضع للإشراف، والتعلم المعزز، واستراتيجية جديدة مدفوعة بالملاحظات تُدعى GenCorrect، يتفوق النظام على أفضل المتسابقين البشر في مجموعة مسائل أولمبياد المعلوماتية 2026.

  • تم تدريب Nemotron-3-Nano-CC (30B-A3B) باستخدام الضبط الدقيق الخاضع للإشراف والتعلم المعزز، بينما استخدم Nemotron-3-Ultra-CC (550B-A55B) الضبط الدقيق الخاضع للإشراف وحده.
  • تُولّد استراتيجية GenCorrect الحلول وتقيّمها وتُحسّنها بشكل تكراري لتحسين الأداء.
  • في أولمبياد المعلوماتية 2025، حصل Nano-CC على 468 نقطة باستخدام GenCorrect، متجاوزاً عتبة الميدالية الذهبية البالغة 438.3.
  • في أولمبياد المعلوماتية 2026، حقق Ultra-CC نتيجة 535.4 من أصل 600 تحت القيود القياسية، متجاوزاً أعلى نتيجة بشرية بلغت 498.27.

يُشكّل هذا المرة الأولى التي يتفوق فيها نظام ذكاء اصطناعي على أعلى متسابق بشري في مجموعة مسائل أولمبياد المعلوماتية، مما يُظهر تقدماً كبيراً في قدرات الاستدلال والبرمجة.