O Relatório Técnico do Qwen2.5 detalha o lançamento de uma série abrangente de modelos de linguagem grandes, incluindo variantes densas de peso aberto e modelos proprietários de mistura de especialistas (MoE). A atualização escala significativamente os dados de pré-treinamento de 7 trilhões para 18 trilhões de tokens e emprega mais de 1 milhão de amostras para o pós-treinamento por meio de ajuste fino supervisionado e aprendizado por reforço.

  • Modelos densos de peso aberto estão disponíveis nos tamanhos de 0,5B, 1,5B, 3B, 7B, 14B, 32B e 72B parâmetros.
  • Os modelos MoE proprietários Qwen2.5-Turbo e Qwen2.5-Plus estão disponíveis via Alibaba Cloud Model Studio.
  • O modelo principal Qwen2.5-72B-Instruct iguala o desempenho do Llama-3-405B-Instruct, apesar de ser cinco vezes menor.
  • O suporte ao comprimento do contexto aumenta de 2K para 8K tokens, com o Qwen2.5-Turbo suportando até 1 milhão de tokens.

Essas melhorias visam fornecer soluções economicamente viáveis para diversos casos de uso, mantendo desempenho de alto nível em benchmarks de raciocínio, codificação e matemática.