Um benchmark do modelo Qwen3.8-27B no conjunto de dados MathArena/aime_2026 demonstra que pesos quantizados em FP8 com esforço de raciocínio xhigh alcançam uma pontuação de 29/30, igualando o desempenho dos modelos BF16 enquanto oferecem throughput significativamente maior.
- FP8 quantizado com raciocínio xhigh alcançou 29/30 (96,7%), igualando o BF16 xhigh, mas com velocidades de pré-preenchimento (3,4K tk/s) e decodificação (76 tk/s) mais rápidas.
- O BF16 medium obteve 28/30, enquanto o BF16 xhigh também alcançou 29/30, mas exigiu uma janela de contexto maior de 258.048 tokens.
- O modelo FP8 superou a linha de base anterior do Qwen3.6-27B de 94,1% e igualou modelos de ponta como Claude Opus 4.6 e DeepSeek V4 Pro em 96,7%.
- Dois problemas resultaram em saídas vazias tanto para BF16 xhigh quanto para FP8 xhigh devido ao esgotamento do orçamento de geração de tokens, em vez de produzir respostas incorretas.