Qwen2.5 기술 보고서는 오픈 가중치 밀집 변형과 독점 혼합 전문가(MoE) 모델을 모두 갖춘 포괄적인 대규모 언어 모델 시리즈의 출시를 상세히 다룹니다. 이번 업데이트는 사전 학습 데이터를 7조 토큰에서 18조 토큰으로 크게 확장했으며, 지도 미세 조정 및 강화 학습을 통해 사후 학습에 100만 개 이상의 샘플을 사용합니다.
- 오픈 가중치 밀집 모델은 0.5B, 1.5B, 3B, 7B, 14B, 32B, 72B 파라미터 크기로 제공됩니다.
- 독점 MoE 모델인 Qwen2.5-Turbo와 Qwen2.5-Plus는 Alibaba Cloud Model Studio를 통해 사용할 수 있습니다.
- 플래그십 Qwen2.5-72B-Instruct은 5분의 1 크기임에도 Llama-3-405B-Instruct과 동등한 성능을 달성합니다.
- 컨텍스트 길이 지원이 2K에서 8K 토큰으로 증가했으며, Qwen2.5-Turbo는 최대 100만 토큰까지 지원합니다.
이러한 개선은 추론, 코딩 및 수학 벤치마크에서 최상위 성능을 유지하면서 다양한 사용 사례에 대한 비용 효율적인 솔루션을 제공하는 것을 목표로 합니다.