Команда Tencent Hy открыла исходный код Hy4-preview, флагманской модели нового поколения Mixture-of-Experts, включающей 770B общих параметров и активирующей 49B на токен. Архитектура состоит из 78 слоев: первый использует плотную FFN, а остальные 77 — MoE с 256 маршрутизируемыми экспертами, а также нативный слой MTP для спекулятивного декодирования.
- Hy4-preview применяет Gated DeepSeek Sparse Attention и Hyper-Connections для улучшения потока информации.
- Обучающие данные были отобраны внутренними экспертами Tencent в области программной инженерии, финансов и разработки игр.
- В слепых сравнительных тестах на 203 задачах программирования Hy4-preview набрал 2.99, немного опередив GLM 5.3 (2.92) и Kimi K3 (2.94).
- Веса доступны в стандартном и FP8 форматах под лицензией Apache License 2.0.
Модель направлена на повышение производительности при решении сложных задач, таких как долгосрочное программирование, анализ данных и научные исследования, с поддержкой развертывания через vLLM и SGLang.