ISTA 심층 알고리즘 및 시스템 연구소는 희소 혼합 전문가 모델인 Qwen3.8-Flash-Next의 양자화된 GGUF 버전을 출시했으며, 동시에 전문가 절반을 제거한 실험적 기능 타겟팅 빌드도 함께 공개했습니다.
- 이번 출시에는 GSQ와 RCO 기술을 사용하여 2.40에서 3.50 bpw(66.4~83.6 GB) 범위의 네 가지 양자화된 GGUF가 포함됩니다.
- 3.50 bpw에서 모델은 GPQA-Diamond와 LiveCodeBench v6를 포함한 모든 평가된 벤치마크에서 BF16 베이스와 동등한 성능을 보입니다.
- 전문가 가지치기 Coder 빌드는 레이어당 라우팅된 512개 중 256개의 전문가를 제거하여 매개변수당 평균 비트폭이 1.89비트가 됩니다.
- 이 가지치기는 잔류 작업 집합을 29.6 GB로 줄여, 176.9B 파라미터 모델을 단일 32 GB 가속기에 적합하게 만듭니다.
양자화된 모델은 크기에 비해 높은 성능을 유지하며, 가지치기된 Coder 빌드는 BF16 기준선 대비 SWE-bench Verified에서 91.3%, LiveCodeBench v6에서 98.7%의 점수를 유지합니다.