L'équipe de Qwen a présenté la série Qwen2.5-Coder, un nouvel ensemble de modèles de langage spécifiques au code dérivés de l'architecture Qwen2.5. La série comprend six tailles de modèle allant de 0,5B à 32B de paramètres et est entraînée sur plus de 5,5 billions de tokens de code source nettoyé et de données synthétiques.
- Les modèles atteignent des performances de pointe dans plus de 10 benchmarks pour la génération, la complétion, le raisonnement et la réparation de code.
- Qwen2.5-Coder-32B-Instruct égale les capacités de codage de GPT-4o tout en conservant de solides compétences générales et mathématiques.
- L'architecture intègre des tokens spéciaux pour prendre en charge les opérations Fill-in-the-Middle (FIM) et la gestion du contexte au niveau du dépôt.
- La publication inclut une licence permissive pour faciliter une adoption plus large par les développeurs.
Les auteurs visent à faire avancer la recherche en intelligence du code et à soutenir des applications réelles grâce à ces modèles open source.