MathArena/aime_2026数据集上的Qwen3.8-27B模型基准测试表明,采用xhigh推理努力的量化FP8权重取得了29/30的分数,与BF16模型的性能相当,同时提供显著更高的吞吐量。
- 采用xhigh推理的量化FP8取得29/30(96.7%),与BF16 xhigh持平,但预填充速度更快(3.4K tok/s)和解码速度更快(76 tok/s)。
- BF16 medium得分为28/30,而BF16 xhigh也达到29/30,但需要更大的上下文窗口,包含258,048个token。
- FP8模型的表现超过了之前Qwen3.6-27B基线的94.1%,并与Claude Opus 4.6和DeepSeek V4 Pro等前沿模型在96.7%的得分上持平。
- 由于耗尽了token生成预算而非产生错误答案,BF16 xhigh和FP8 xhigh在两个问题上均产生了空输出。