Qwen 팀은 Qwen2 기술 보고서를 발표하며 0.5억에서 720억 파라미터에 이르는 새로운 대규모 언어 모델 시리즈를 소개했습니다. 여기에는 Dense 아키텍처와 Mixture-of-Experts (MoE) 아키텍처가 모두 포함됩니다.
- 플래그십 Qwen2-72B 베이스 모델은 MMLU에서 84.2, GSM8K에서 89.5, HumanEval에서 64.6의 점수를 달성했습니다.
- 지시문 튜닝된 Qwen2-72B-Instruct 변형 모델은 MT-Bench에서 9.1, LiveCodeBench에서 35.7에 도달했습니다.
- 모델은 7조 개 이상의 토큰으로 학습되었으며 약 30개 언어를 지원합니다.
- 가중치는 커뮤니티 사용을 위해 Hugging Face 및 ModelScope에서 공개적으로 제공됩니다.
이번 릴리스는 연구 및 배포에 접근 가능하면서도 독점 시스템과 경쟁할 수 있는 고성능 기반 모델을 제공하는 것을 목표로 합니다.