Empat model bahasa besar telah dirilis di Tiongkok dalam sebulan terakhir: Kimi K3-2.8T, Qwen3.8-2.4T, DeepSeek-V4-Pro-0813-1.6T, dan GLM-5.3-743B.
Kimi K3, Qwen3.8, DeepSeek-V4-Pro-0813, dan GLM-5.3 dirilis dalam sebulan
xAI merilis Grok 4.6; Alibaba membuka Qwen3.8-MoE; DeepSeek V4 Pro GA
Berita AI minggu ini menyoroti peluncuran besar dari xAI, Alibaba, dan DeepSeek, bersama pembaruan pada model video terbuka dan infrastruktur inferensi.
Thinking Machines merilis Inkling, Tencent memperbarui Hy3 dengan lisensi Apache 2.0
Ringkasan terbaru artefak model terbuka menyoroti rilis signifikan dari Thinking Machines dan Tencent, bersama pembaruan dari Poolside dan DeepSeek.
Rilis Qwen3.8 dengan bobot terbuka, Kimi Code CLI, tumpukan LLM Netflix, perangkat keras chip Alibaba
Alibaba mengumumkan rilis Qwen3.8 dengan bobot terbuka, sebuah model dengan 2,4 triliun parameter, sambil juga membuka sumber tumpukan perangkat lunak chip AI Zhenwu-nya untuk mengurangi ketergantungan pada ekosistem CUDA milik Nvidia.
Kimi K3, DeepSeek V4 Pro, dan GLM-5.2 dibandingkan pada benchmark, lisensi, dan biaya penyajian
Sebuah perbandingan tiga model Sparse Mixture-of-Experts berbobot terbuka—Kimi K3 dari Moonshot AI, DeepSeek V4 Pro, dan GLM-5.2 dari Zhipu AI—mengevaluasi kemampuan, ketentuan lisensi, dan biaya penyajian mereka untuk beban kerja pemrograman jangka panjang dan agen.
Mendistilasi deepseek-r1:8B ke Qwen3-0.6B memungkinkan pengayaan teks terstruktur perangkat-on yang cepat
Peneliti menunjukkan bahwa mendistilasi guru penalaran 8B (deepseek-r1:8B) ke dalam model siswa 0,6B (Qwen3-0.6B melalui QLoRA) memungkinkan ekstraksi terstruktur volume tinggi dengan latensi dan biaya yang secara signifikan lebih rendah. Studi ini mengevaluasi pendekatan ini pada pemetaan artikel berita ke objek JSON yang berisi ringkasan dan label kategorikal, membandingkan model yang didistilasi dengan baseline few-shot prompting dan constrained decoding.