Бенчмарк модели Qwen3.8-27B на наборе данных MathArena/aime_2026 показывает, что квантованные веса FP8 при высоком уровне рассуждений достигают результата 29/30, сопоставимого с производительностью моделей BF16, но обеспечивая значительно более высокую пропускную способность.

  • Квантование FP8 с высоким уровнем рассуждений показало результат 29/30 (96,7%), равный результату BF16 xhigh, но с более высокой скоростью предварительного заполнения (3,4K ток/с) и декодирования (76 ток/с).
  • Модель BF16 medium набрала 28/30, тогда как BF16 xhigh также достигла 29/30, но потребовала большего контекстного окна в 258 048 токенов.
  • Модель FP8 превзошла предыдущий базовый результат Qwen3.6-27B в 94,1% и сравнялась с передовыми моделями, такими как Claude Opus 4.6 и DeepSeek V4 Pro, показав 96,7%.
  • По двум задачам обе модели BF16 xhigh и FP8 xhigh выдали пустые ответы из-за исчерпания бюджета генерации токенов, а не из-за неправильных ответов.