Berita AI minggu ini menyoroti rilis model bobot terbuka yang signifikan dari Z.ai, Tencent, dan Alibaba, bersamaan dengan perkembangan dalam infrastruktur inferensi dan benchmarking agen.

  • Z.ai merilis GLM-5.3 dengan 744B parameter total untuk pemrograman agentic dan pertahanan siber, sementara varian Flash-nya menawarkan kualitas lebih tinggi dengan biaya lebih rendah.
  • Tencent meluncurkan Hy4-preview, model MoE 770B yang menunjukkan peningkatan kinerja substansial dibandingkan Hy3 dalam tugas generasi kode.
  • Alibaba memperkenalkan Qwen3.8-Flash, model MoE 125B yang dirancang untuk inferensi multimodal konteks panjang dengan biaya murah, meskipun laporan awal mencatat masalah stabilitas dengan kuantisasi FP8.
  • vLLM menerbitkan benchmark yang membandingkan metode decoding spekulatif, menemukan tidak ada pemenang universal dan menekankan penyesuaian spesifik beban kerja.
  • Alibaba Accio membuka sumber CommerceAgentBench, sebuah benchmark 107-tugas yang mengukur penyelesaian tugas aktual daripada hanya kualitas jawaban.
  • Penelitian Google menunjukkan bahwa keterampilan portabel yang disimpan dalam wiki persisten ditransfer secara efektif di seluruh keluarga model, berpotensi menawarkan kemampuan agen yang lebih robust dibandingkan fine-tuning.