Le laboratoire Deep Algorithms and Systems d'ISTA a publié des versions quantifiées au format GGUF du modèle sparse mixture-of-experts Qwen3.8-Flash-Next, ainsi qu'une build expérimentale ciblée sur les capacités avec la moitié de ses experts supprimés.
- La publication inclut quatre GGUF quantifiés allant de 2.40 à 3.50 bpw (66.4 à 83.6 GB) utilisant les techniques GSQ et RCO.
- À 3.50 bpw, le modèle égale la base BF16 sur tous les benchmarks évalués, y compris GPQA-Diamond et LiveCodeBench v6.
- La build Coder élaguée supprime 256 des 512 experts routés par couche, résultant en une largeur de bits moyenne de 1.89 bits par paramètre.
- Cet élagage réduit l'ensemble de travail résident à 29.6 GB, permettant au modèle de 176.9B paramètres de tenir dans un seul accélérateur de 32 GB.
Les modèles quantifiés maintiennent des performances élevées par rapport à leur taille, tandis que la build Coder élaguée conserve 91.3 % des scores SWE-bench Verified et 98.7 % des scores LiveCodeBench v6 par rapport à la référence BF16.