Alibaba Cloud telah membuka sumber seri model bahasa dense decoder-only Qwen2.5, menambahkan tiga ukuran baru (3B, 14B, dan 32B) ke jajaran yang sudah ada mulai dari 0.5B hingga 72B parameter. Pembaruan ini memperluas dataset pra-pelatihan dari 7 triliun menjadi 18 triliun token dan mengintegrasikan terobosan teknis dari Qwen2.5-Coder dan Qwen-math untuk secara signifikan meningkatkan kinerja dalam coding, matematika, dan pengetahuan umum.

  • Model Qwen2.5-32B unggul dibandingkan Qwen2-72B, sementara Qwen2.5-14B melampaui Qwen2-57B-A14B dalam evaluasi komprehensif.
  • Peningkatan pengetahuan terlihat pada benchmark MMLU, dengan skor Qwen2.5-7B/72B naik dari 70.3 menjadi 74.2 dan dari 84.2 menjadi 86.1 masing-masing.
  • Kemampuan coding meningkat secara substansial, dengan Qwen2.5-72B-Instruct mencapai skor 55.5 pada LiveCodeBench dan 88.2 pada MBPP.
  • Kemampuan matematika meningkat signifikan, menaikkan skor benchmark MATH untuk Qwen2.5-7B/72B-Instruct dari 52.9/69.0 menjadi 75.5/83.1.
  • Penyesuaian preferensi manusia membaik, dengan skor Arena-Hard untuk Qwen2.5-72B-Instruct melonjak dari 48.1 menjadi 81.2.
  • Dukungan panjang konteks diperluas hingga 128K token, dan sebagian besar model dilisensikan di bawah Apache 2.0.

Rilis ini menjawab permintaan pengguna akan model produksi yang hemat biaya dalam rentang 10-30B dan model 3B yang dioptimalkan untuk mobile, menawarkan alternatif open-source yang sangat kompetitif yang setara atau melampaui sistem proprietary yang lebih besar.