Технический отчет Qwen2.5 описывает выпуск комплексной серии больших языковых моделей, включающей как открытые плотные варианты, так и проприетарные модели смеси экспертов (MoE). Обновление значительно увеличивает объем данных для предобучения с 7 триллионов до 18 триллионов токенов и использует более миллиона образцов для постобучения посредством контролируемой тонкой настройки и обучения с подкреплением.

  • Открытые плотные модели доступны в размерах 0.5B, 1.5B, 3B, 7B, 14B, 32B и 72B параметров.
  • Проприетарные MoE-модели Qwen2.5-Turbo и Qwen2.5-Plus доступны через Alibaba Cloud Model Studio.
  • Флагманская модель Qwen2.5-72B-Instruct демонстрирует производительность, сопоставимую с Llama-3-405B-Instruct, несмотря на то, что она в пять раз меньше.
  • Поддержка длины контекста увеличена с 2K до 8K токенов, при этом Qwen2.5-Turbo поддерживает до 1 миллиона токенов.

Эти улучшения направлены на предоставление экономически эффективных решений для различных задач при сохранении высочайшей производительности в задачах рассуждения, программирования и математики.