Rilis v0.29.0rc2 menyertakan perbaikan bug untuk cache pekerja SHM agar dapat menangani item yang dicakup awalan dengan benar.
- Menyelesaikan masalah di mana item yang dicakup awalan tidak ditangani dengan benar dalam cache pekerja SHM.
Rilis v0.29.0rc2 menyertakan perbaikan bug untuk cache pekerja SHM agar dapat menangani item yang dicakup awalan dengan benar.
DeepSeek telah menerbitkan checkpoint model DeepSeek-V4-Flash-Vision-Exp di Hugging Face. Repositori sekarang tersedia untuk akses publik.
Tim Qwen Alibaba telah merilis Qwen3.8-Flash-Next, model Mixture-of-Experts multimodal berbobot terbuka yang dirancang untuk mendahului arsitektur seri Qwen4 mendatang. Titik pemeriksaan ini menggabungkan tulang punggung 125B dengan tabel embedding N-gram 51B dan modul prediksi multi-token 4B, mengaktifkan hanya 6B parameter per token.
Zhipu AI telah merilis GLM-5.3-Flash, model multimodal asli pertama dalam seri GLM-5 dan rilis bobot terbuka pertama dari arsitektur glm5_next. Model dengan 320B parameter ini dilatih pada korpus multimodal berukuran 30T token dan memiliki mekanisme perhatian hibrida yang menggabungkan pendekatan sparse dan linear untuk mengurangi biaya penyajian konteks panjang.
Zai telah memperkenalkan GLM-5.3-Flash, model multimodal asli pertama dalam seri GLM-5. Model ini memiliki arsitektur hibrida yang menggabungkan perhatian jarang dan linear untuk mengurangi biaya layanan konteks panjang sambil mempertahankan kemampuan yang presisi.
ZhiPu memperkenalkan GLM-5.3-Flash, model multimodal asli pertama dalam seri GLM-5, yang menggunakan arsitektur hibrida yang menggabungkan perhatian sparse dan linear untuk mengurangi biaya layanan konteks panjang sambil mempertahankan presisi.
Kami menggunakan cookie untuk mengukur lalu lintas dan meningkatkan situs. Anda dapat menerima atau menolak cookie analitik. Kebijakan privasi