알리바바는 Qwen2.5 기술 보고서를 출시하여, 사전 학습과 사후 학습 단계 모두에서 상당한 개선을 갖춘 대규모 언어 모델의 포괄적인 시리즈를 소개했습니다. 이 업데이트는 고품질 사전 학습 데이터셋을 7조 토큰에서 18조 토큰으로 확장하고, 100만 개 이상의 샘플과 함께 복잡한 지도 미세 조정 및 다단계 강화 학습을 구현합니다.
- 오픈 가중치 제공물에는 기본 모델과 지시어 튜닝된 모델이 포함되며, 양자화된 버전도 제공됩니다.
- 독점 호스팅 솔루션에는 두 가지 혼합 전문가(MoE) 변형인 Qwen2.5-Turbo와 Qwen2.5-Plus가 포함되어 있습니다.
- 플래그십 Qwen2.5-72B-Instruct는 많은 오픈 및 독점 모델을 능가하며, Llama-3-405B-Instruct와 경쟁적인 성능을 보여줍니다.
- Qwen2.5-Turbo와 Qwen2.5-Plus는 GPT-4o-mini 및 GPT-4o 각각과 경쟁적인 성능을 유지하면서 뛰어난 비용 효율성을 제공합니다.
이러한 향상은 상식, 전문가 지식 및 추론 능력에 강력한 기반을 제공하며, 사후 학습 기법은 긴 텍스트 생성, 구조적 데이터 분석 및 지시어 추종 능력을 특히 개선합니다.