L'équipe Qwen a publié la série Qwen2, évoluant depuis Qwen1.5 avec cinq nouvelles tailles de modèles : Qwen2-0.5B, Qwen2-1.5B, Qwen2-7B, Qwen2-57B-A14B et Qwen2-72B. Ces modèles sont désormais disponibles sur Hugging Face et ModelScope.

  • Toutes les tailles de modèles utilisent l'attention à requête groupée (GQA) pour une inférence plus rapide et une réduction de l'utilisation de la mémoire.
  • Les données d'entraînement incluent 27 langues supplémentaires en plus de l'anglais et du chinois pour améliorer les capacités multilingues.
  • Qwen2-7B-Instruct et Qwen2-72B-Instruct prennent en charge des longueurs de contexte étendues jusqu'à 128K tokens en utilisant YARN.
  • Le modèle Qwen2-72B démontre des performances supérieures par rapport à Llama-3-70B et son prédécesseur Qwen1.5-110B malgré un nombre de paramètres inférieur.
  • Des améliorations significatives ont été apportées au codage, aux mathématiques et à l'alignement de la sécurité grâce à des stratégies automatisées de post-entraînement.

La sortie vise à fournir des modèles open-source avec des performances de pointe en compréhension du langage naturel, raisonnement et tâches multilingues tout en maintenant des normes de sécurité solides.