Команда Tencent Hy открыла исходный код Hy4-preview, флагманской модели нового поколения Mixture-of-Experts, включающей 770B общих параметров и активирующей 49B на токен. Архитектура состоит из 78 слоев: первый использует плотную FFN, а остальные 77 — MoE с 256 маршрутизируемыми экспертами, а также нативный слой MTP для спекулятивного декодирования.

  • Hy4-preview применяет Gated DeepSeek Sparse Attention и Hyper-Connections для улучшения потока информации.
  • Обучающие данные были отобраны внутренними экспертами Tencent в области программной инженерии, финансов и разработки игр.
  • В слепых сравнительных тестах на 203 задачах программирования Hy4-preview набрал 2.99, немного опередив GLM 5.3 (2.92) и Kimi K3 (2.94).
  • Веса доступны в стандартном и FP8 форматах под лицензией Apache License 2.0.

Модель направлена на повышение производительности при решении сложных задач, таких как долгосрочное программирование, анализ данных и научные исследования, с поддержкой развертывания через vLLM и SGLang.