تقدم ورقة DeepSeekMath نموذج لغة مفتوح المصدر بـ 7 مليارات معلمة مصمم لتعزيز قدرات الاستدلال الرياضي. تم إنشاء النموذج عن طريق مواصلة التدريب المسبق لـ DeepSeek-Coder-Base-v1.5 مع 120 مليار رمز متعلق بالرياضيات من Common Crawl، جنبًا إلى جنب مع بيانات اللغة الطبيعية والكود.

  • حقق DeepSeekMath 7B نتيجة 51.7% على معيار MATH على مستوى المسابقات دون استخدام مجموعات أدوات خارجية أو تقنيات تصويت.
  • وصلت الاتساق الذاتي عبر 64 عينة إلى 60.9% على معيار MATH.
  • يُعزى الأداء إلى خط أنابيب مختار لاختيار البيانات وتحسين السياسة النسبية للمجموعة (GRPO).
  • GRPO هو متغير من تحسين السياسة القريبة يحسن الاستدلال أثناء تحسين استخدام الذاكرة.

يُعتبر المؤلفون هذا الأمر مهمًا لأن النموذج يقترب من مستوى أداء النماذج الخاصة مثل Gemini-Ultra وGPT-4.