DeepSeek ha lanzado DeepSeek-Coder-V2, un modelo de lenguaje de código de expertos mixtos (MoE) de código abierto que alcanza un rendimiento comparable al de GPT-4 Turbo en tareas específicas de codificación. El modelo se pre-entrena adicionalmente desde un punto de control intermedio de DeepSeek-V2 utilizando 6 billones de tokens adicionales.

  • Mejora las capacidades de razonamiento de codificación y matemáticas mientras mantiene el rendimiento general del lenguaje.
  • Amplía el soporte de lenguajes de programación de 86 a 338 lenguajes.
  • Extiende la longitud del contexto de 16K a 128K.
  • Supera a modelos de código cerrado como GPT-4 Turbo, Claude 3 Opus y Gemini 1.5 Pro en benchmarks de codificación y matemáticas.

Este lanzamiento proporciona una alternativa abierta de alto rendimiento para la inteligencia de código, ofreciendo avances significativos sobre su predecesor DeepSeek-Coder-33B.