El Informe Técnico de Qwen2.5 detalla el lanzamiento de una serie integral de modelos de lenguaje grandes que incluye variantes densas de peso abierto y modelos propietarios de mezcla de expertos (MoE). La actualización escala significativamente los datos de preentrenamiento de 7 mil millones a 18 mil millones de tokens y emplea más de 1 millón de muestras para el entrenamiento posterior mediante ajuste fino supervisado y aprendizaje por refuerzo.

  • Los modelos densos de peso abierto están disponibles en tamaños de 0.5B, 1.5B, 3B, 7B, 14B, 32B y 72B parámetros.
  • Los modelos MoE propietarios Qwen2.5-Turbo y Qwen2.5-Plus están disponibles a través de Alibaba Cloud Model Studio.
  • El modelo insignia Qwen2.5-72B-Instruct iguala el rendimiento de Llama-3-405B-Instruct a pesar de ser cinco veces más pequeño.
  • El soporte de longitud de contexto aumenta de 2K a 8K tokens, con Qwen2.5-Turbo que admite hasta 1 millón de tokens.

Estas mejoras tienen como objetivo proporcionar soluciones rentables para diversos casos de uso mientras mantienen un rendimiento de primer nivel en los benchmarks de razonamiento, codificación y matemáticas.