DeepSeekは、コード固有のタスクにおいてGPT-4 Turboと同等のパフォーマンスを実現するオープンソースのMixture-of-Experts (MoE) コード言語モデル「DeepSeek-Coder-V2」をリリースしました。本モデルは、DeepSeek-V2の中間チェックポイントからさらに6兆トークンを使用して追加で事前学習されています。
- 一般的な言語パフォーマンスを維持しつつ、コーディングおよび数学的推論能力を強化します。
- プログラミング言語のサポートを86から338に拡大します。
- コンテキスト長を16Kから128Kに拡張します。
- コーディングおよび数学ベンチマークにおいて、GPT-4 Turbo、Claude 3 Opus、Gemini 1.5 Proなどのクローズドソースモデルを上回ります。
今回のリリースは、コードインテリジェンスのための高性能なオープン代替手段を提供し、前身であるDeepSeek-Coder-33Bに対して大幅な進歩をもたらします。