L'équipe Tencent Hy a open-sourcé Hy4-preview, un nouveau modèle phare Mixture-of-Experts de nouvelle génération comprenant 770B de paramètres au total avec 49B activés par token. L'architecture comporte 78 couches où la première utilise un FFN dense et les 77 suivantes utilisent MoE avec 256 experts routés, ainsi qu'une couche MTP native pour le décodage spéculatif.
- Hy4-preview emploie l'Attention Sparse Gated de DeepSeek et des Hyper-Connexions identitaires pour améliorer le flux d'informations.
- Les données d'entraînement ont été curatées avec des experts internes de Tencent en génie logiciel, finance et développement de jeux.
- Dans des évaluations aveugles côte à côte sur 203 tâches d'ingénierie, Hy4-preview a obtenu un score de 2.99, légèrement devant GLM 5.3 (2.92) et Kimi K3 (2.94).
- Les poids sont disponibles en formats standard et FP8 sous la licence Apache 2.0.
Le modèle vise à améliorer la productivité sur des tâches complexes comme le codage long-horizon, l'analyse de données et la recherche scientifique, avec un support de déploiement pour vLLM et SGLang.