Tim Qwen telah merilis seri Qwen2, yang berevolusi dari Qwen1.5 dengan lima ukuran model baru: Qwen2-0.5B, Qwen2-1.5B, Qwen2-7B, Qwen2-57B-A14B, dan Qwen2-72B. Model-model ini kini tersedia di Hugging Face dan ModelScope.

  • Semua ukuran model menggunakan Group Query Attention (GQA) untuk inferensi yang lebih cepat dan penggunaan memori yang berkurang.
  • Data pelatihan mencakup 27 bahasa tambahan selain bahasa Inggris dan Mandarin untuk meningkatkan kemampuan multibahasa.
  • Qwen2-7B-Instruct dan Qwen2-72B-Instruct mendukung panjang konteks hingga 128K token menggunakan YARN.
  • Model Qwen2-72B menunjukkan kinerja yang lebih unggul dibandingkan Llama-3-70B dan pendahulunya Qwen1.5-110B meskipun memiliki parameter yang lebih sedikit.
  • Peningkatan signifikan dilakukan dalam pemrograman, matematika, dan keselarasan keamanan melalui strategi pasca-pelatihan otomatis.

Rilis ini bertujuan untuk menyediakan model sumber terbuka dengan kinerja mutakhir di berbagai tugas pemahaman bahasa alami, penalaran, dan multibahasa sambil mempertahankan standar keamanan yang kuat.