Una evaluación del modelo Qwen3.8-27B en el conjunto de datos MathArena/aime_2026 demuestra que los pesos cuantizados en FP8 con esfuerzo de razonamiento xhigh alcanzan una puntuación de 29/30, igualando el rendimiento de los modelos BF16 mientras ofrecen un throughput significativamente mayor.

  • FP8 cuantizado con razonamiento xhigh logró 29/30 (96.7%), igualando a BF16 xhigh pero con velocidades de pre-fill más rápidas (3.4K tk/s) y de decode (76 tk/s).
  • BF16 medium obtuvo 28/30, mientras que BF16 xhigh también alcanzó 29/30 pero requirió una ventana de contexto mayor de 258,048 tokens.
  • El modelo FP8 superó la línea base anterior de Qwen3.6-27B de 94.1% e igualó a modelos de vanguardia como Claude Opus 4.6 y DeepSeek V4 Pro en 96.7%.
  • Dos problemas resultaron en salidas vacías tanto para BF16 xhigh como para FP8 xhigh debido a agotar el presupuesto de generación de tokens en lugar de producir respuestas incorrectas.