ISTA深度算法与系统实验室发布了稀疏混合专家模型Qwen3.8-Flash-Next的量化GGUF版本,以及一个移除了半数专家的实验性能力定向构建版本。
- 该发布包含四个使用GSQ和RCO技术量化的GGUF文件,范围从2.40到3.50 bpw(66.4至83.6 GB)。
- 在3.50 bpw时,该模型在所有评估的基准测试中均与BF16基础模型持平,包括GPQA-Diamond和LiveCodeBench v6。
- 专家剪枝的Coder构建移除了每层512个路由专家中的256个,导致每个参数的平均位宽为1.89位。
- 这种剪枝将驻留工作集减少到29.6 GB,使得拥有176.9B参数的模型能够适应单个32 GB加速器。
量化模型相对于其大小保持了高性能,而剪枝的Coder构建保留了SWE-bench Verified的91.3%和LiveCodeBench v6的98.7%分数,与BF16基线相比。