Tim Qwen telah menerbitkan laporan teknis Qwen2, memperkenalkan seri baru model bahasa besar yang berkisar dari 0,5 hingga 72 miliar parameter, termasuk arsitektur padat dan Mixture-of-Experts (MoE).
- Model dasar andalan Qwen2-72B mencapai skor 84,2 di MMLU, 89,5 di GSM8K, dan 64,6 di HumanEval.
- Varian Qwen2-72B-Instruct yang telah disesuaikan dengan instruksi mencapai 9,1 di MT-Bench dan 35,7 di LiveCodeBench.
- Model dilatih pada lebih dari 7 triliun token dan mendukung sekitar 30 bahasa.
- Bobot tersedia secara terbuka di Hugging Face dan ModelScope untuk penggunaan komunitas.
Rilis ini bertujuan untuk menyediakan model dasar berkinerja tinggi yang bersaing dengan sistem tertutup, sambil tetap dapat diakses untuk penelitian dan penyebaran.