MathArena/aime_2026データセットにおけるQwen3.8-27Bモデルのベンチマークは、xhigh推論努力において量子化されたFP8重みが29/30のスコアを達成し、BF16モデルのパフォーマンスに匹敵しつつ、大幅に高いスループットを提供することを示している。
- xhigh推論による量子化FP8は29/30(96.7%)を達成し、BF16 xhighと同等だが、より高速なプリフィル(3.4K tk/s)とデコード速度(76 tk/s)を実現した。
- BF16 mediumは28/30のスコアであり、BF16 xhighも29/30に到達したが、258,048トークンのより大きなコンテキストウィンドウを必要とした。
- FP8モデルは以前のQwen3.6-27Bベースラインである94.1%を上回り、Claude Opus 4.6やDeepSeek V4 Proのような最先端モデルと96.7%で同等の性能を示した。
- BF16 xhighとFP8 xhighの両方で、誤った回答を生成するのではなくトークン生成予算を使い果たしたため、2つの問題で空の出力となった。