알리바바의 Qwen 팀은 다가오는 Qwen4 시리즈의 아키텍처를 미리 보여주기 위해 설계된 오픈 가중치 멀티모달 Mixture-of-Experts 모델인 Qwen3.8-Flash-Next를 출시했습니다. 이 체크포인트는 125B 백본과 51B N-gram 임베딩 테이블, 그리고 4B 다중 토큰 예측 모듈을 결합하여 토큰당 6B 파라미터만 활성화합니다.

  • 아키텍처: 네 레이어 중 세 레이어에는 Gated DeltaNet(선형 어텐션)과 Qwen Sparse Attention을 혼합하여 사용하고, 나머지 한 레이어에는 Gated Residual 스트림과 Muon 옵티마이저를 함께 사용합니다.
  • 벤치마크: DeepSWE 1.1에서 58.7, SWE-bench Pro에서 62.5, LiveCodeBench v6에서 91.9, 코드 인터프리터와 함께 MathVision에서 95.7을 달성했습니다.
  • 효율성: 학습 비용은 Qwen3.7-Plus의 약 9분의 1 수준이며, 서빙 시 높은 접두사 캐시 히트율에서 최대 10.2배의 프리필스 처리량 증가를 보입니다.
  • 컨텍스트 및 저장소: 기본적으로 262,144 토큰을 지원하며(YaRN을 통해 1M까지 확장 가능); FP8 체크포인트는 172.78 GiB로, 멀티 GPU 배포가 필요합니다.

이 모델은 Qwen4의 초기 아키텍처 미리보기 역할을 하며, 코딩 및 추론 벤치마크에서 경쟁력 있는 성능을 유지하면서 상당한 비용 절감과 속도 개선을 제공합니다.