A equipe do Qwen lançou a série Qwen2, evoluindo do Qwen1.5 com cinco novos tamanhos de modelo: Qwen2-0.5B, Qwen2-1.5B, Qwen2-7B, Qwen2-57B-A14B e Qwen2-72B. Esses modelos estão agora disponíveis no Hugging Face e ModelScope.
- Todos os tamanhos de modelo utilizam Group Query Attention (GQA) para inferência mais rápida e redução do uso de memória.
- Os dados de treinamento incluem 27 idiomas adicionais além do inglês e chinês para melhorar as capacidades multilíngues.
- Qwen2-7B-Instruct e Qwen2-72B-Instruct suportam comprimentos de contexto estendidos de até 128K tokens usando YARN.
- O modelo Qwen2-72B demonstra desempenho superior em comparação ao Llama-3-70B e seu predecessor Qwen1.5-110B, apesar de ter menos parâmetros.
- Melhorias significativas foram feitas em codificação, matemática e alinhamento de segurança por meio de estratégias automatizadas de pós-treinamento.
O lançamento visa fornecer modelos de código aberto com desempenho de ponta em compreensão de linguagem natural, raciocínio e tarefas multilíngues, mantendo padrões de segurança robustos.