MathArena/aime_2026 데이터셋에서 Qwen3.8-27B 모델에 대한 벤치마크는 xhigh 추론 노력으로 양자화된 FP8 가중치가 29/30의 점수를 달성하여 BF16 모델의 성능과 동일함을 보여주지만, 훨씬 더 높은 처리량을 제공한다고 밝혔습니다.

  • xhigh 추론으로 양자화된 FP8가 29/30(96.7%)를 달성하여 BF16 xhigh와 동등하지만, 더 빠른 프리필(3.4K tk/s) 및 디코딩 속도(76 tk/s)를 제공합니다.
  • BF16 미드는 28/30을 기록한 반면, BF16 xhigh도 29/30에 도달했지만 258,048 토큰의 더 큰 컨텍스트 창이 필요했습니다.
  • FP8 모델은 이전 Qwen3.6-27B 기준선인 94.1%를 능가했으며 Claude Opus 4.6 및 DeepSeek V4 Pro와 같은 최첨단 모델과 96.7%로 동률을 이뤘습니다.
  • 두 문제는 BF16 xhigh와 FP8 xhigh 모두에서 토큰 생성 예산을 고갈시켜 잘못된 답안을 생성하는 것이 아니라 빈 출력을 발생시켰습니다.