Laporan Teknis Qwen2.5 merinci rilis serangkaian lengkap model bahasa besar yang mencakup varian dense berbobot terbuka dan model mixture-of-experts (MoE) tertutup. Pembaruan ini secara signifikan meningkatkan data pra-pelatihan dari 7 triliun menjadi 18 triliun token dan menggunakan lebih dari 1 juta sampel untuk pasca-pelatihan melalui penyetelan halus terawasi dan pembelajaran penguatan.
- Model dense berbobot terbuka tersedia dalam ukuran 0.5B, 1.5B, 3B, 7B, 14B, 32B, dan 72B parameter.
- Model MoE tertutup Qwen2.5-Turbo dan Qwen2.5-Plus tersedia melalui Alibaba Cloud Model Studio.
- Qwen2.5-72B-Instruct andalannya setara dengan Llama-3-405B-Instruct meskipun ukurannya lima kali lebih kecil.
- Dukungan panjang konteks meningkat dari 2K menjadi 8K token, dengan Qwen2.5-Turbo mendukung hingga 1 juta token.
Peningkatan ini bertujuan untuk memberikan solusi hemat biaya untuk berbagai kasus penggunaan sambil mempertahankan kinerja tingkat atas pada benchmark penalaran, pemrograman, dan matematika.