Le rapport technique Qwen2.5 détaille la publication d'une série complète de grands modèles de langage (LLM) comprenant à la fois des variantes denses à poids ouverts et des modèles propriétaires à mélange d'experts (MoE). La mise à jour augmente considérablement les données de pré-entraînement, passant de 7 billions à 18 billions de jetons, et utilise plus d'un million d'échantillons pour l'entraînement postérieur via le réglage fin supervisé et l'apprentissage par renforcement.

  • Les modèles denses à poids ouverts sont disponibles en tailles de 0,5B, 1,5B, 3B, 7B, 14B, 32B et 72B paramètres.
  • Les modèles MoE propriétaires Qwen2.5-Turbo et Qwen2.5-Plus sont disponibles via Alibaba Cloud Model Studio.
  • Le modèle phare Qwen2.5-72B-Instruct égale les performances de Llama-3-405B-Instruct tout en étant cinq fois plus petit.
  • La prise en charge de la longueur du contexte passe de 2K à 8K jetons, Qwen2.5-Turbo prenant en charge jusqu'à 1 million de jetons.

Ces améliorations visent à fournir des solutions rentables pour divers cas d'utilisation tout en maintenant des performances de premier ordre sur les benchmarks de raisonnement, de codage et de mathématiques.