Alibaba Cloud a ouvert en open source la série Qwen2.5 de modèles de langage denses à décodeur unique, ajoutant trois nouvelles tailles (3B, 14B et 32B) à la gamme existante allant de 0,5B à 72B de paramètres. Cette mise à jour étend le jeu de données de pré-entraînement de 7 billions à 18 billions de tokens et intègre des avancées techniques issues de Qwen2.5-Coder et Qwen-math pour améliorer significativement les performances en codage, mathématiques et connaissances générales.

  • Le modèle Qwen2.5-32B surpasse Qwen2-72B, tandis que Qwen2.5-14B dépasse Qwen2-57B-A14B dans les évaluations complètes.
  • L'amélioration des connaissances est visible sur les benchmarks MMLU, avec les scores de Qwen2.5-7B/72B passant de 70,3 à 74,2 et de 84,2 à 86,1 respectivement.
  • Les capacités de codage se sont considérablement améliorées, Qwen2.5-72B-Instruct atteignant 55,5 sur LiveCodeBench et 88,2 sur MBPP.
  • La capacité mathématique a augmenté significativement, les scores du benchmark MATH pour Qwen2.5-7B/72B-Instruct passant de 52,9/69,0 à 75,5/83,1.
  • L'alignement des préférences humaines s'est amélioré, les scores Arena-Hard pour Qwen2.5-72B-Instruct bondissant de 48,1 à 81,2.
  • Le support de la longueur du contexte s'étend à 128K tokens, et la plupart des modèles sont sous licence Apache 2.0.

Cette publication répond à la demande des utilisateurs pour des modèles de production rentables dans la gamme 10-30B et des modèles mobiles optimisés de 3B, offrant des alternatives open source hautement compétitives qui égalent ou dépassent les systèmes propriétaires plus grands.