Makalah DeepSeekMath memperkenalkan model bahasa terbuka 7B parameter yang dirancang untuk meningkatkan kemampuan penalaran matematika. Model ini dibuat dengan melanjutkan pra-pelatihan DeepSeek-Coder-Base-v1.5 dengan 120B token terkait matematika dari Common Crawl, bersama dengan data bahasa alami dan kode.

  • DeepSeekMath 7B mencetak skor 51,7% pada benchmark MATH tingkat kompetisi tanpa toolkit eksternal atau teknik voting.
  • Konsistensi diri atas 64 sampel mencapai 60,9% pada benchmark MATH.
  • Performa ini dikaitkan dengan pipeline seleksi data kurasi dan Optimisasi Kebijakan Relatif Grup (GRPO).
  • GRPO adalah varian dari Optimisasi Kebijakan Proksimal yang meningkatkan penalaran sambil mengoptimalkan penggunaan memori.

Para penulis menganggap ini signifikan karena model tersebut mendekati tingkat performa model tertutup seperti Gemini-Ultra dan GPT-4.