Сравнение GLM-5.3 и её дистиллированной версии GLM-5.3 Flash на бенчмарке DeepSWE показывает, что дистилляция сохраняет базовые способности к программированию, значительно снижая стоимость генерации ответов. Полная модель достигает показателя pass@1 на уровне 69,0% при стоимости $3,99 за задачу, тогда как версия Flash набирает 63,4% всего за $0,24, что представляет собой снижение цены в 17 раз.

  • Разрыв в качестве сокращается с 5,6 пункта на pass@1 до 2,6 пункта на pass@4 (87,6% против 85,0%), что указывает на то, что потери связаны преимущественно с надёжностью, а не со способностями.
  • GLM-5.3 Flash стоит $0,24 за генерацию ответа по сравнению с $3,99 для полной модели, что позволяет решать 264 задачи на каждые $100 против 17 задач.
  • Версия Flash теряет способность превращать дополнительные усилия в успех на нестабильных задачах: успешные попытки занимают больше шагов лишь в 46% случаев по сравнению с 61% для полной модели.
  • Дистилляция изменила профиль производительности, улучшив результаты в области параллелизма, Python и моделирования данных, но уступив позиции в JavaScript и задачах с тяжёлыми запросами.
  • Заметная регрессия заключается в снижении осторожности: Flash ломает базовые тесты в 6,9% генераций ответов по сравнению с 4,4% для полной модели.

Запуск GLM-5.3 Flash с последующим переходом к полной модели только при отклонении результата позволяет решить 80,9% задач DeepSWE при стоимости $1,70 за каждую, предлагая экономически эффективную стратегию для нагрузок, ограниченных пропускной способностью.