Alibaba a publié le rapport technique de Qwen2.5, présentant une série complète de grands modèles de langage avec des améliorations significatives tant au stade du pré-entraînement qu'à celui du post-entraînement. La mise à jour étend les ensembles de données de pré-entraînement de haute qualité de 7 billions à 18 billions de tokens et met en œuvre un affinage supervisé complexe avec plus d'un million d'échantillons, ainsi qu'un apprentissage par renforcement multi-étapes.

  • Les offres à poids ouverts incluent des modèles de base et des modèles ajustés pour les instructions, avec des versions quantifiées disponibles.
  • Les solutions hébergées propriétaires proposent deux variantes en mélange d'experts : Qwen2.5-Turbo et Qwen2.5-Plus.
  • Le modèle phare Qwen2.5-72B-Instruct surpasse de nombreux modèles ouverts et propriétaires, affichant des performances compétitives par rapport à Llama-3-405B-Instruct.
  • Qwen2.5-Turbo et Qwen2.5-Plus offrent une meilleure rentabilité tout en restant compétitifs face à GPT-4o-mini et GPT-4o respectivement.

Ces améliorations fournissent une base solide pour le bon sens, les connaissances expertes et les capacités de raisonnement, tandis que les techniques de post-entraînement améliorent notablement la génération de longs textes, l'analyse de données structurées et le suivi des instructions.