Un benchmark du modèle Qwen3.8-27B sur le jeu de données MathArena/aime_2026 démontre que les poids quantifiés en FP8 avec un effort de raisonnement xhigh atteignent un score de 29/30, égalant les performances des modèles BF16 tout en offrant un débit significativement plus élevé.

  • Le FP8 quantifié avec raisonnement xhigh a obtenu 29/30 (96,7 %), égalant le BF16 xhigh mais avec des vitesses de pré-remplissage (3,4 K tok/s) et de décodage (76 tok/s) plus rapides.
  • Le BF16 medium a obtenu 28/30, tandis que le BF16 xhigh a également atteint 29/30 mais nécessitait une fenêtre de contexte plus large de 258 048 tokens.
  • Le modèle FP8 a surpassé la référence précédente Qwen3.6-27B de 94,1 % et égalé les modèles de pointe comme Claude Opus 4.6 et DeepSeek V4 Pro à 96,7 %.
  • Deux problèmes ont donné des sorties vides pour le BF16 xhigh et le FP8 xhigh en raison de l'épuisement du budget de génération de tokens plutôt que par la production de réponses incorrectes.