A equipe Tencent Hy disponibilizou como código aberto o Hy4-preview, um novo modelo flagship Mixture-of-Experts de nova geração que compreende 770B de parâmetros totais, com 49B ativados por token. A arquitetura possui 78 camadas, onde a primeira utiliza uma FFN densa e as restantes 77 utilizam MoE com 256 especialistas roteados, além de uma camada MTP nativa para decodificação especulativa.

  • O Hy4-preview emprega Gated DeepSeek Sparse Attention e Hyper-Connections de identidade para melhorar o fluxo de informações.
  • Os dados de treinamento foram curados por especialistas internos da Tencent em engenharia de software, finanças e desenvolvimento de jogos.
  • Em avaliações cegas lado a lado em 203 tarefas de engenharia, o Hy4-preview obteve pontuação de 2.99, ligeiramente à frente do GLM 5.3 (2.92) e do Kimi K3 (2.94).
  • Os pesos estão disponíveis nos formatos padrão e FP8 sob a Licença Apache 2.0.

O modelo visa melhorar a produtividade em tarefas complexas como codificação de longo prazo, análise de dados e pesquisa científica, com suporte de implantação para vLLM e SGLang.