Z.ai merilis GLM-5.3-Flash, model MoE multimodal 320B-parameter dengan 18B parameter aktif, sementara tim Alibaba Qwen merilis Qwen3.8-Flash-Next, model 125B dengan 6B parameter aktif. Meskipun dikembangkan secara independen, kedua tim mengadopsi konfigurasi arsitektur yang hampir identik.

  • Kedua model menggunakan hibrida 3:1 antara lapisan perhatian linier dan penuh untuk menyeimbangkan efisiensi dan presisi.
  • Konteks dikompresi dengan faktor 4 melalui pengindeks yang dipelajari yang membatasi anggaran perhatian jarang pada 2048 token.
  • Aliran residu tunggal diganti oleh empat cabang gerbang paralel untuk meningkatkan kontrol aliran dan mengurangi overhead memori.
  • Pelatihan menggunakan optimizer Muon dengan matriks proyeksi terfusi yang dibagi menjadi transformasi independen sebelum ortogonalisasi.
  • Kedua tim berselisih mengenai pengodean posisi: GLM membuang RoPE untuk NoPE, sementara Qwen mempertahankan RoPE setelah varian NoPE gagal menghentikan generasi pasca-pelatihan.

Konvergensi ini menunjukkan arah industri bersama untuk pemodelan konteks panjang yang efisien, meskipun MiniMax tetap menjadi penentang dengan menolak perhatian linier karena defisit penalaran.