DeepSeek telah menerbitkan checkpoint model DeepSeek-V4-Flash-Vision-Exp di Hugging Face. Repositori sekarang tersedia untuk akses publik.
DeepSeek merilis DeepSeek-V4-Flash-Vision-Exp di Hugging Face
Thinking Machines merilis Inkling, Tencent memperbarui Hy3 dengan lisensi Apache 2.0
Ringkasan terbaru artefak model terbuka menyoroti rilis signifikan dari Thinking Machines dan Tencent, bersama pembaruan dari Poolside dan DeepSeek.
Thinking Machines Lab merilis model fondasi Inkling dengan bobot terbuka
Thinking Machines Lab telah meluncurkan Inkling, keluarga model fondasi berbobot terbuka yang sepenuhnya dirilis. Diposisikan sebagai model dasar multimodal yang dapat dikustomisasi alih-alih model unggulan yang memaksimalkan benchmark, Inkling mendukung input teks, gambar, dan audio dengan multimodalitas asli.
Tim Qwen Alibaba merilis Qwen3.8-Flash-Next, pratinjau MoE 125B yang mendahului Qwen4
Tim Qwen Alibaba telah merilis Qwen3.8-Flash-Next, model Mixture-of-Experts multimodal berbobot terbuka yang dirancang untuk mendahului arsitektur seri Qwen4 mendatang. Titik pemeriksaan ini menggabungkan tulang punggung 125B dengan tabel embedding N-gram 51B dan modul prediksi multi-token 4B, mengaktifkan hanya 6B parameter per token.
Zhipu AI merilis GLM-5.3-Flash, model bobot terbuka multimodal
Zhipu AI telah merilis GLM-5.3-Flash, model multimodal asli pertama dalam seri GLM-5 dan rilis bobot terbuka pertama dari arsitektur glm5_next. Model dengan 320B parameter ini dilatih pada korpus multimodal berukuran 30T token dan memiliki mekanisme perhatian hibrida yang menggabungkan pendekatan sparse dan linear untuk mengurangi biaya penyajian konteks panjang.
ZhiPu merilis GLM-5.3-Flash, model multimodal dengan 320B parameter
ZhiPu memperkenalkan GLM-5.3-Flash, model multimodal asli pertama dalam seri GLM-5, yang menggunakan arsitektur hibrida yang menggabungkan perhatian sparse dan linear untuk mengurangi biaya layanan konteks panjang sambil mempertahankan presisi.