Lab Algoritma dan Sistem Deep ISTA telah merilis versi GGUF terkuantisasi dari model sparse mixture-of-experts Qwen3.8-Flash-Next, bersama dengan build eksperimental yang ditargetkan pada kemampuan tertentu dengan separuh ahlinya dihilangkan.
- Rilis ini mencakup empat GGUF terkuantisasi yang berkisar dari 2,40 hingga 3,50 bpw (66,4 hingga 83,6 GB) menggunakan teknik GSQ dan RCO.
- Pada 3,50 bpw, model tersebut setara dengan basis BF16 pada setiap benchmark yang dievaluasi, termasuk GPQA-Diamond dan LiveCodeBench v6.
- Build Coder yang memangkas ahli menghilangkan 256 dari 512 ahli terarah per lapisan, menghasilkan bitwidth rata-rata 1,89 bit per parameter.
- Pemangkasan ini mengurangi working set residensial menjadi 29,6 GB, memungkinkan model dengan 176,9B parameter muat dalam satu akselerator 32 GB.
Model terkuantisasi mempertahankan kinerja tinggi relatif terhadap ukurannya, sementara build Coder yang dipangkas mempertahankan 91,3% skor SWE-bench Verified dan 98,7% skor LiveCodeBench v6 dibandingkan dengan baseline BF16.