DeepSeek ha lanzado DeepSeek-Coder-V2, un modelo de lenguaje de código de expertos mixtos (MoE) de código abierto que alcanza un rendimiento comparable al de GPT-4 Turbo en tareas específicas de codificación. El modelo se pre-entrena adicionalmente desde un punto de control intermedio de DeepSeek-V2 utilizando 6 billones de tokens adicionales.
- Mejora las capacidades de razonamiento de codificación y matemáticas mientras mantiene el rendimiento general del lenguaje.
- Amplía el soporte de lenguajes de programación de 86 a 338 lenguajes.
- Extiende la longitud del contexto de 16K a 128K.
- Supera a modelos de código cerrado como GPT-4 Turbo, Claude 3 Opus y Gemini 1.5 Pro en benchmarks de codificación y matemáticas.
Este lanzamiento proporciona una alternativa abierta de alto rendimiento para la inteligencia de código, ofreciendo avances significativos sobre su predecesor DeepSeek-Coder-33B.