A equipe da Qwen apresentou a série Qwen2.5-Coder, um novo conjunto de modelos de linguagem específicos para código derivados da arquitetura Qwen2.5. A série inclui seis tamanhos de modelo variando de 0.5B a 32B parâmetros e é treinada em mais de 5.5 trilhões de tokens de código-fonte limpo e dados sintéticos.

  • Os modelos alcançam desempenho de estado da arte em mais de 10 benchmarks para geração, conclusão, raciocínio e reparo de código.
  • Qwen2.5-Coder-32B-Instruct iguala as capacidades de codificação do GPT-4o enquanto mantém fortes habilidades gerais e matemáticas.
  • A arquitetura incorpora tokens especiais para suportar operações Fill-in-the-Middle (FIM) e gerenciamento de contexto em nível de repositório.
  • O lançamento inclui licenciamento permissivo para facilitar uma adoção mais ampla por desenvolvedores.

Os autores visam avançar a pesquisa em inteligência de código e apoiar aplicações do mundo real através desses modelos de código aberto.