MathArena/aime_2026 डेटासेट पर Qwen3.8-27B मॉडल का एक बेंचमार्क दिखाता है कि उच्च तर्क प्रयास के साथ क्वांटाइज्ड FP8 वजन ने 29/30 स्कोर हासिल किया, जो BF16 मॉडलों की प्रदर्शन क्षमता से मेल खाता है जबकि काफी अधिक थ्रूपुट प्रदान करता है।
- उच्च तर्क के साथ क्वांटाइज्ड FP8 ने 29/30 (96.7%) हासिल किया, जो BF16 उच्च के बराबर है लेकिन तेज़ प्री-फिल (3.4K tk/s) और डिकोड गति (76 tk/s) के साथ।
- BF16 मीडियम ने 28/30 स्कोर किया, जबकि BF16 उच्च ने भी 29/30 तक पहुंचा लेकिन इसके लिए 258,048 टोकन का बड़ा संदर्भ विंडो आवश्यक था।
- FP8 मॉडल ने पिछले Qwen3.6-27B बेलाइन के 94.1% को पार किया और Claude Opus 4.6 और DeepSeek V4 Pro जैसे फ्रंटियर मॉडलों के साथ 96.7% पर बराबरी की।
- दोनों BF16 उच्च और FP8 उच्च के लिए दो समस्याओं में खाली आउटपुट आए क्योंकि टोकन जनरेशन बजट समाप्त हो गया, गलत उत्तर देने के बजाय।