Le rapport technique Qwen2 présente la série Qwen2, une nouvelle suite de grands modèles linguistiques et multimodaux fondamentaux et ajustés pour les instructions, allant de 0,5 à 72 milliards de paramètres. Cette version inclut à la fois des architectures denses et un modèle Mixture-of-Experts, le modèle phare Qwen2-72B démontrant des performances compétitives par rapport aux modèles propriétaires sur divers benchmarks.
- Le modèle de base Qwen2-72B obtient des scores de 84,2 sur MMLU, 37,9 sur GPQA, 64,6 sur HumanEval, 89,5 sur GSM8K et 82,4 sur BBH.
- La variante ajustée pour les instructions Qwen2-72B-Instruct atteint 9,1 sur MT-Bench, 48,1 sur Arena-Hard et 35,7 sur LiveCodeBench.
- Les modèles prennent en charge environ 30 langues, dont l'anglais, le chinois, l'espagnol, le français, l'allemand, l'arabe, le russe, le coréen, le japonais, le thaï et le vietnamien.
- Les poids des modèles sont ouvertement disponibles sur Hugging Face et ModelScope, avec du code supplémentaire et des ressources de déploiement fournis sur GitHub.
Les auteurs publient ces poids pour favoriser l'innovation communautaire et l'accessibilité, en fournissant des ressources pour la quantification, le fine-tuning et le déploiement afin de faciliter une large gamme d'applications et de projets de recherche.