El equipo de Qwen ha lanzado la serie Qwen2, evolucionando desde Qwen1.5 con cinco nuevos tamaños de modelo: Qwen2-0.5B, Qwen2-1.5B, Qwen2-7B, Qwen2-57B-A14B y Qwen2-72B. Estos modelos ya están disponibles en Hugging Face y ModelScope.

  • Todos los tamaños de modelo utilizan Group Query Attention (GQA) para una inferencia más rápida y un menor uso de memoria.
  • Los datos de entrenamiento incluyen 27 idiomas adicionales además del inglés y el chino para mejorar las capacidades multilingües.
  • Qwen2-7B-Instruct y Qwen2-72B-Instruct admiten longitudes de contexto extendidas de hasta 128K tokens utilizando YARN.
  • El modelo Qwen2-72B demuestra un rendimiento superior en comparación con Llama-3-70B y su predecesor Qwen1.5-110B a pesar de tener menos parámetros.
  • Se realizaron mejoras significativas en codificación, matemáticas y alineación de seguridad mediante estrategias automatizadas de postentrenamiento.

El lanzamiento tiene como objetivo proporcionar modelos de código abierto con un rendimiento de vanguardia en comprensión del lenguaje natural, razonamiento y tareas multilingües, manteniendo al mismo tiempo fuertes estándares de seguridad.