Лаборатория глубоких алгоритмов и систем ISTA выпустила квантованные версии в формате GGUF для модели с разреженной смесью экспертов Qwen3.8-Flash-Next, а также экспериментальную сборку, ориентированную на целевые возможности, в которой удалена половина её экспертов.
- В релиз включены четыре квантованных GGUF-файла с размером от 2.40 до 3.50 bpw (от 66.4 до 83.6 ГБ), использующие техники GSQ и RCO.
- При размере 3.50 bpw модель соответствует базовой версии BF16 по всем оцененным бенчмаркам, включая GPQA-Diamond и LiveCodeBench v6.
- Сборка Coder с удалением экспертов убирает 256 из 512 маршрутизируемых экспертов на слой, что приводит к средней разрядности 1.89 бита на параметр.
- Это сокращение уменьшает resident working set до 29.6 ГБ, позволяя модели с 176.9B параметров поместиться в один акселератор объемом 32 ГБ.
Квантованные модели сохраняют высокую производительность относительно своего размера, а сборка Coder с удалением экспертов сохраняет 91.3% результатов SWE-bench Verified и 98.7% результатов LiveCodeBench v6 по сравнению с базовой версией BF16.