Berita AI minggu ini menyoroti rilis model bobot terbuka yang signifikan dari Z.ai, Tencent, dan Alibaba, bersamaan dengan perkembangan dalam infrastruktur inferensi dan benchmarking agen.
- Z.ai merilis GLM-5.3 dengan 744B parameter total untuk pemrograman agentic dan pertahanan siber, sementara varian Flash-nya menawarkan kualitas lebih tinggi dengan biaya lebih rendah.
- Tencent meluncurkan Hy4-preview, model MoE 770B yang menunjukkan peningkatan kinerja substansial dibandingkan Hy3 dalam tugas generasi kode.
- Alibaba memperkenalkan Qwen3.8-Flash, model MoE 125B yang dirancang untuk inferensi multimodal konteks panjang dengan biaya murah, meskipun laporan awal mencatat masalah stabilitas dengan kuantisasi FP8.
- vLLM menerbitkan benchmark yang membandingkan metode decoding spekulatif, menemukan tidak ada pemenang universal dan menekankan penyesuaian spesifik beban kerja.
- Alibaba Accio membuka sumber CommerceAgentBench, sebuah benchmark 107-tugas yang mengukur penyelesaian tugas aktual daripada hanya kualitas jawaban.
- Penelitian Google menunjukkan bahwa keterampilan portabel yang disimpan dalam wiki persisten ditransfer secara efektif di seluruh keluarga model, berpotensi menawarkan kemampuan agen yang lebih robust dibandingkan fine-tuning.