Sebuah benchmark model Qwen3.8-27B pada dataset MathArena/aime_2026 menunjukkan bahwa bobot terkuantisasi FP8 dengan upaya reasoning xhigh mencapai skor 29/30, menyamai kinerja model BF16 sambil menawarkan throughput yang jauh lebih tinggi.
- FP8 terkuantisasi dengan reasoning xhigh mencapai 29/30 (96,7%), menyamai BF16 xhigh tetapi dengan kecepatan pre-fill lebih cepat (3,4K tok/s) dan decode (76 tok/s).
- BF16 medium meraih skor 28/30, sementara BF16 xhigh juga mencapai 29/30 namun memerlukan jendela konteks yang lebih besar sebesar 258.048 token.
- Model FP8 mengungguli baseline Qwen3.6-27B sebelumnya sebesar 94,1% dan menyamai model terdepan seperti Claude Opus 4.6 dan DeepSeek V4 Pro pada 96,7%.
- Dua soal menghasilkan output kosong untuk BF16 xhigh dan FP8 xhigh karena habisnya batas generasi token, bukan karena menghasilkan jawaban yang salah.