El equipo Tencent Hy ha liberado como código abierto Hy4-preview, un nuevo modelo insignia Mixture-of-Experts de nueva generación que comprende 770B de parámetros totales con 49B activados por token. La arquitectura cuenta con 78 capas donde la primera utiliza una FFN densa y las restantes 77 usan MoE con 256 expertos enrutados, junto a una capa nativa MTP para decodificación especulativa.

  • Hy4-preview emplea Atención Esparsa Gated de DeepSeek e Hyper-Conexiones de identidad para mejorar el flujo de información.
  • Los datos de entrenamiento fueron curados con expertos internos de Tencent en ingeniería de software, finanzas y desarrollo de videojuegos.
  • En evaluaciones ciegas lado a lado en 203 tareas de ingeniería, Hy4-preview obtuvo 2.99, ligeramente por delante de GLM 5.3 (2.92) y Kimi K3 (2.94).
  • Los pesos están disponibles en formatos estándar y FP8 bajo la Licencia Apache 2.0.

El modelo tiene como objetivo mejorar la productividad en tareas complejas como codificación a largo plazo, análisis de datos e investigación científica, con soporte de despliegue para vLLM y SGLang.