O Laboratório de Algoritmos Profundos e Sistemas da ISTA lançou versões GGUF quantizadas do modelo mistura esparsa de especialistas Qwen3.8-Flash-Next, juntamente com uma compilação experimental voltada a capacidades específicas, com metade de seus especialistas removidos.
- O lançamento inclui quatro GGUFs quantizados variando de 2,40 a 3,50 bpw (66,4 a 83,6 GB) usando técnicas GSQ e RCO.
- Em 3,50 bpw, o modelo iguala a base BF16 em todos os benchmarks avaliados, incluindo GPQA-Diamond e LiveCodeBench v6.
- A compilação Coder podada remove 256 dos 512 especialistas roteados por camada, resultando em uma largura de banda média de 1,89 bits por parâmetro.
- Essa poda reduz o conjunto de trabalho residente para 29,6 GB, permitindo que o modelo de 176,9B parâmetros caiba dentro de um único acelerador de 32 GB.
Os modelos quantizados mantêm alto desempenho em relação ao seu tamanho, enquanto a compilação Coder podada retém 91,3% das pontuações do SWE-bench Verified e 98,7% das pontuações do LiveCodeBench v6 em comparação com a linha de base BF16.