Qwen 팀은 Qwen1.5에서 진화한 Qwen2 시리즈를 출시했으며, 새로운 모델 크기 5종이 포함되었습니다: Qwen2-0.5B, Qwen2-1.5B, Qwen2-7B, Qwen2-57B-A14B, 그리고 Qwen2-72B. 이러한 모델들은 이제 Hugging Face와 ModelScope에서 사용할 수 있습니다.
- 모든 모델 크기는 더 빠른 추론과 메모리 사용량 감소를 위해 Group Query Attention(GQA)을 활용합니다.
- 훈련 데이터에는 영어와 중국어 외에도 27개 추가 언어가 포함되어 다국어 능력을 향상시켰습니다.
- Qwen2-7B-Instruct 및 Qwen2-72B-Instruct는 YARN을 사용하여 최대 128K 토큰까지 확장된 컨텍스트 길이를 지원합니다.
- Qwen2-72B 모델은 매개변수가 더 적음에도 불구하고 Llama-3-70B와 전작인 Qwen1.5-110B보다 우수한 성능을 보여줍니다.
- 자동화된 사후 훈련 전략을 통해 코딩, 수학 및 안전 정렬 분야에서 상당한 개선을 이루었습니다.
이번 출시는 자연어 이해, 추론 및 다국어 작업에서 최상위 성능을 제공하는 오픈소스 모델을 제공하면서도 강력한 안전 기준을 유지하는 것을 목표로 합니다.