Alibaba Cloud ha abierto el código fuente de la serie de modelos de lenguaje densos decoder-only Qwen2.5, añadiendo tres nuevos tamaños (3B, 14B y 32B) a la línea existente que abarca desde 0.5B hasta 72B parámetros. Esta actualización amplía el conjunto de datos de preentrenamiento de 7 mil millones a 18 mil millones de tokens e integra avances técnicos de Qwen2.5-Coder y Qwen-math para mejorar significativamente el rendimiento en codificación, matemáticas y conocimiento general.
- El modelo Qwen2.5-32B supera a Qwen2-72B, mientras que Qwen2.5-14B supera a Qwen2-57B-A14B en evaluaciones integrales.
- La mejora del conocimiento es evidente en los benchmarks MMLU, con las puntuaciones de Qwen2.5-7B/72B aumentando de 70.3 a 74.2 y de 84.2 a 86.1 respectivamente.
- Las capacidades de codificación mejoraron sustancialmente, con Qwen2.5-72B-Instruct logrando 55.5 en LiveCodeBench y 88.2 en MBPP.
- La habilidad matemática aumentó significativamente, elevando las puntuaciones del benchmark MATH para Qwen2.5-7B/72B-Instruct de 52.9/69.0 a 75.5/83.1.
- La alineación con preferencias humanas mejoró, con las puntuaciones Arena-Hard para Qwen2.5-72B-Instruct saltando de 48.1 a 81.2.
- El soporte de longitud de contexto se extiende hasta 128K tokens, y la mayoría de los modelos están licenciados bajo Apache 2.0.
El lanzamiento responde a la demanda de usuarios de modelos de producción rentables en el rango de 10-30B y modelos optimizados para móviles de 3B, ofreciendo alternativas de código abierto altamente competitivas que igualan o superan a sistemas propietarios más grandes.