알리바바 클라우드는 기존 0.5B에서 72B 파라미터에 이르는 라인업에 3B, 14B, 32B의 세 가지 새로운 크기를 추가하여 디코더 전용 밀집 언어 모델인 Qwen2.5 시리즈를 오픈소스로 공개했습니다. 이번 업데이트는 사전 학습 데이터셋을 7조 토큰에서 18조 토큰으로 확장하고, Qwen2.5-Coder와 Qwen-math의 기술적 돌파구를 통합하여 코딩, 수학, 일반 지식 분야에서 성능을 크게 개선했습니다.

  • Qwen2.5-32B 모델은 Qwen2-72B를 압도하며, Qwen2.5-14B는 종합 평가에서 Qwen2-57B-A14B를 능가합니다.
  • MMLU 벤치마크에서 지식 강화가 뚜렷하게 나타나며, Qwen2.5-7B/72B의 점수가 각각 70.3에서 74.2로, 84.2에서 86.1로 상승했습니다.
  • 코딩 능력이 크게 향상되어 Qwen2.5-72B-Instruct가 LiveCodeBench에서 55.5, MBPP에서 88.2를 기록했습니다.
  • 수학 능력이 현저히 증가하여 Qwen2.5-7B/72B-Instruct의 MATH 벤치마크 점수가 52.9/69.0에서 75.5/83.1로 상승했습니다.
  • 인간 선호도 정렬이 개선되어 Qwen2.5-72B-Instruct의 Arena-Hard 점수가 48.1에서 81.1로 급증했습니다.
  • 컨텍스트 길이 지원이 128K 토큰까지 확장되었으며, 대부분의 모델은 Apache 2.0 라이선스를 따릅니다.

이번 출시물은 10-30B 범위의 비용 효율적인 프로덕션 모델과 모바일 최적화 3B 모델에 대한 사용자 수요를 충족하며, 더 큰 독점 시스템과 맞먹거나 이를 능가하는 매우 경쟁력 있는 오픈소스 대안을 제공합니다.