Tim Qwen Alibaba telah merilis Qwen3.8-Flash-Next, model Mixture-of-Experts multimodal berbobot terbuka yang dirancang untuk mendahului arsitektur seri Qwen4 mendatang. Titik pemeriksaan ini menggabungkan tulang punggung 125B dengan tabel embedding N-gram 51B dan modul prediksi multi-token 4B, mengaktifkan hanya 6B parameter per token.
- Arsitektur: Menggunakan hibrida Gated DeltaNet (perhatian linear) untuk tiga dari empat lapisan dan Qwen Sparse Attention untuk lapisan keempat, bersama dengan aliran residu tergerbang dan pengoptimal Muon.
- Benchmark: Mencapai skor 58.7 pada DeepSWE 1.1, 62.5 pada SWE-bench Pro, 91.9 pada LiveCodeBench v6, dan 95.7 pada MathVision dengan interpreter kode.
- Efisiensi: Biaya pelatihan sekitar sepersembilan dari Qwen3.7-Plus; layanan menunjukkan peningkatan throughput pengisian hingga 10.2x pada tingkat hit cache prefix tinggi.
- Konteks & Penyimpanan: Mendukung 262,144 token secara native (dapat diperluas hingga 1M melalui YaRN); titik pemeriksaan FP8 berukuran 172.78 GiB, memerlukan penyebaran multi-GPU.
Model ini berfungsi sebagai pratinjau arsitektur awal untuk Qwen4, menawarkan pengurangan biaya yang signifikan dan peningkatan kecepatan sambil mempertahankan kinerja kompetitif pada benchmark pemrograman dan penalaran.