Tencent Hyチームは、770Bの総パラメータを持ち、1トークンあたり49Bが活性化される新世代のMixture-of-ExpertsフラッグシップモデルであるHy4-previewをオープンソース化した。アーキテクチャは78層で構成され、最初の層は密なFFNを使用し、残りの77層は256のルーティング済みエクスパートを持つMoEを採用しており、さらに推論デコーディング用のネイティブMTP層も備えている。

  • Hy4-previewは、情報フローを強化するためにGated DeepSeek Sparse Attentionと恒等Hyper-Connectionsを採用している。
  • 訓練データは、ソフトウェアエンジニアリング、金融、ゲーム開発の分野におけるTencent内部の専門家によってキュレーションされた。
  • 203のエンジニアリングタスクに対するブラインドな並列評価において、Hy4-previewは2.99のスコアを獲得し、GLM 5.3 (2.92) や Kimi K3 (2.94) をわずかに上回った。
  • 重みはApache License 2.0の下で標準形式およびFP8形式で利用可能である。

このモデルは、長期のコーディング、データ分析、科学研究などの複雑なタスク全体の生産性向上を目指しており、vLLM および SGLang でのデプロイメントをサポートしている。