ISTAディープアルゴリズム&システムラボは、スパース混合ExpertsモデルQwen3.8-Flash-Nextの量子化GGUF版と、そのExpertsの半分を削除した実験的な能力特化ビルドをリリースしました。

  • リリースにはGSQおよびRCO技術を用いた2.40〜3.50 bpw(66.4〜83.6 GB)の4つの量子化GGUFが含まれます。
  • 3.50 bpwにおいて、モデルはGPQA-DiamondやLiveCodeBench v6を含むすべての評価ベンチマークでBF16ベースラインと同等のパフォーマンスを発揮します。
  • 专家プルーニング済みCoderビルドは層ごとに512あるルーティングExpertsのうち256を削除し、パラメータあたりの平均ビット幅を1.89 bitsに抑えます。
  • このプルーニングにより残存ワークセットが29.6 GBに削減され、176.9Bパラメータのモデルが単一の32 GBアクセラレータに収まるようになります。

量子化モデルはサイズに対して高いパフォーマンスを維持し、プルーニング済みCoderビルドはBF16ベースラインと比較してSWE-bench Verifiedで91.3%、LiveCodeBench v6で98.7%のスコアを保持します。