DeepSeek выпустила DeepSeek-Coder-V2, открытую модель языка кода на основе архитектуры Mixture-of-Experts (MoE), которая демонстрирует производительность, сопоставимую с GPT-4 Turbo в специализированных задачах по кодированию. Модель дополнительно дообучена на промежуточном чекпоинте DeepSeek-V2 с использованием дополнительных 6 триллионов токенов.
- Улучшает способности к программированию и математическому рассуждению, сохраняя общую языковую производительность.
- Расширяет поддержку языков программирования с 86 до 338.
- Увеличивает длину контекста с 16K до 128K.
- Превосходит закрытые модели, такие как GPT-4 Turbo, Claude 3 Opus и Gemini 1.5 Pro, в бенчмарках по кодированию и математике.
Это издание предоставляет высокопроизводительную открытую альтернативу для кодовой аналитики, предлагая значительные улучшения по сравнению с предыдущей версией DeepSeek-Coder-33B.