A Alibaba Cloud lançou como código aberto a série Qwen2.5 de modelos de linguagem densos apenas decodificadores, adicionando três novos tamanhos (3B, 14B e 32B) à linha existente que varia de 0,5B a 72B parâmetros. Esta atualização expande o conjunto de dados de pré-treinamento de 7 trilhões para 18 trilhões de tokens e integra avanços técnicos do Qwen2.5-Coder e Qwen-math para melhorar significativamente o desempenho em codificação, matemática e conhecimento geral.

  • O modelo Qwen2.5-32B supera o Qwen2-72B, enquanto o Qwen2.5-14B supera o Qwen2-57B-A14B em avaliações abrangentes.
  • O aprimoramento do conhecimento é evidente nos benchmarks MMLU, com as pontuações do Qwen2.5-7B/72B subindo de 70,3 para 74,2 e de 84,2 para 86,1, respectivamente.
  • As capacidades de codificação melhoraram substancialmente, com o Qwen2.5-72B-Instruct alcançando 55,5 no LiveCodeBench e 88,2 no MBPP.
  • A habilidade matemática aumentou significativamente, elevando as pontuações do benchmark MATH para Qwen2.5-7B/72B-Instruct de 52,9/69,0 para 75,5/83,1.
  • O alinhamento com preferências humanas melhorou, com as pontuações do Arena-Hard para Qwen2.5-72B-Instruct saltando de 48,1 para 81,2.
  • O suporte ao comprimento do contexto se estende a 128K tokens, e a maioria dos modelos está licenciada sob Apache 2.0.

O lançamento atende à demanda dos usuários por modelos de produção com bom custo-benefício na faixa de 10-30B e modelos otimizados para mobile de 3B, oferecendo alternativas open-source altamente competitivas que igualam ou superam sistemas proprietários maiores.