El Laboratorio de Algoritmos Profundos y Sistemas de ISTA ha publicado versiones cuantizadas en formato GGUF del modelo de mezcla dispersa de expertos Qwen3.8-Flash-Next, junto con una compilación experimental orientada a capacidades específicas que elimina la mitad de sus expertos.

  • El lanzamiento incluye cuatro GGUFs cuantizados que van desde 2.40 hasta 3.50 bpw (66.4 a 83.6 GB) utilizando técnicas GSQ y RCO.
  • A 3.50 bpw, el modelo iguala a la base BF16 en todas las evaluaciones de benchmarks, incluyendo GPQA-Diamond y LiveCodeBench v6.
  • La compilación de Coder con poda elimina 256 de los 512 expertos enrutados por capa, lo que resulta en un ancho de bits promedio de 1.89 bits por parámetro.
  • Esta poda reduce el conjunto de trabajo residente a 29.6 GB, permitiendo que el modelo de 176.9B parámetros se ajuste dentro de un único acelerador de 32 GB.

Los modelos cuantizados mantienen un alto rendimiento en relación con su tamaño, mientras que la compilación de Coder podado conserva el 91.3% de las puntuaciones de SWE-bench Verified y el 98.7% de las de LiveCodeBench v6 en comparación con la línea base BF16.