Команда Qwen представила серию Qwen2.5-Coder, новый набор языковых моделей, специализированных для работы с кодом, созданных на базе архитектуры Qwen2.5. Серия включает шесть размеров моделей от 0.5B до 32B параметров и обучена на более чем 5.5 триллионах токенов очищенного исходного кода и синтетических данных.
- Модели демонстрируют наилучшие результаты более чем в 10 бенчмарках для генерации кода, завершения, рассуждений и исправления ошибок.
- Qwen2.5-Coder-32B-Instruct сопоставим по возможностям программирования с GPT-4o, сохраняя при этом сильные общие и математические навыки.
- Архитектура включает специальные токены для поддержки операций Fill-in-the-Middle (FIM) и управления контекстом на уровне репозитория.
- Выпуск включает разрешительную лицензию для облегчения более широкого внедрения разработчиками.
Авторы стремятся продвинуть исследования в области интеллекта кода и поддержать практические приложения с помощью этих моделей с открытым исходным кодом.