Tim Tencent Hy telah membuka sumber Hy4-preview, model unggulan Mixture-of-Experts generasi baru yang terdiri dari 770B total parameter dengan 49B diaktifkan per token. Arsitekturnya memiliki 78 lapisan di mana lapisan pertama menggunakan FFN padat dan 77 lapisan sisanya menggunakan MoE dengan 256 ahli terarah, bersama lapisan MTP asli untuk dekode spekulatif.

  • Hy4-preview menerapkan Gated DeepSeek Sparse Attention dan Hyper-Connections identitas untuk meningkatkan aliran informasi.
  • Data pelatihan dikurasi oleh pakar internal Tencent di bidang rekayasa perangkat lunak, keuangan, dan pengembangan game.
  • Dalam evaluasi buta berdampingan pada 203 tugas rekayasa, Hy4-preview mencetak skor 2.99, sedikit unggul dari GLM 5.3 (2.92) dan Kimi K3 (2.94).
  • Bobot tersedia dalam format standar dan FP8 di bawah Lisensi Apache 2.0.

Model ini bertujuan meningkatkan produktivitas di berbagai tugas kompleks seperti pemrograman jangka panjang, analisis data, dan penelitian ilmiah, dengan dukungan penyebaran untuk vLLM dan SGLang.