텐센트 Hy 팀은 총 770B의 파라미터를 가지며 토큰당 49B가 활성화되는 새로운 세대의 Mixture-of-Experts 플래그십 모델인 Hy4-preview를 오픈소스로 공개했습니다. 이 아키텍처는 78개의 레이어로 구성되어 있으며, 첫 번째 레이어는 밀집 FFN을 사용하고 나머지 77개 레이어는 256개의 라우팅된 전문가를 갖춘 MoE를 사용하며, 추론 디코딩을 위한 네이티브 MTP 레이어도 포함됩니다.
- Hy4-preview는 정보 흐름을 향상시키기 위해 Gated DeepSeek Sparse Attention과 identity Hyper-Connections을 사용합니다.
- 학습 데이터는 소프트웨어 엔지니어링, 금융, 게임 개발 분야의 내부 텐센트 전문가들이 선별했습니다.
- 203개의 엔지니어링 작업에 대한 블라인드 병렬 평가에서 Hy4-preview는 2.99점을 받아 GLM 5.3 (2.92)과 Kimi K3 (2.94)보다 약간 앞섰습니다.
- 가중치는 Apache License 2.0 하에 표준 및 FP8 형식으로 제공됩니다.
이 모델은 장기적인 코딩, 데이터 분석, 과학 연구와 같은 복잡한 작업 전반의 생산성 향상을 목표로 하며, vLLM과 SGLang에 대한 배포 지원을 제공합니다.