Anthropic menerbitkan artikel penelitian berjudul "GLM-5.3 dan Penyebaran Kemampuan Siber Canggih", yang memeriksa bagaimana model open-source seperti GLM-5 digunakan dalam aktivitas siber jahat. Artikel tersebut menyoroti bahwa model-model ini telah diadopsi secara luas oleh aktor ancaman, secara efektif berfungsi sebagai iklan untuk kemampuan mereka di komunitas keamanan. Analisis ini menekankan kekhawatiran yang meningkat mengenai sifat penggunaan ganda dari model AI canggih dan potensi mereka untuk memperkuat ancaman siber.
Riset Anthropic menghubungkan GLM-5 dengan penyebaran kemampuan siber canggih
Anthropic menemukan GLM-5.3 mencapai hijack aliran kontrol penuh dalam red teaming siber
Frontier Red Team Anthropic mengevaluasi model Tiongkok GLM-5.3 pada 100 tugas dari benchmark Binary Exploitation internal dan menemukan bahwa model tersebut mampu mengembangkan hijack aliran kontrol penuh dalam 4% percobaan.
Anthropic menganalisis GLM-5.3 dan penyebaran kemampuan siber canggih
Anthropic telah menerbitkan artikel penelitian yang memeriksa GLM-5.3 dan perannya dalam diseminasi kemampuan siber canggih.
Model frontier dievaluasi pada permainan log(N)-Questions di atas Wikipedia
Sebuah studi mengevaluasi enam model bahasa frontier pada tugas komunikasi dua agen di mana penanya mengidentifikasi target dari N paragraf Wikipedia menggunakan tepat log2(N) pertanyaan ya/tidak. Eksperimen ini menjalankan 408 permainan di atas kumpulan dokumen berukuran 4 hingga 1024 paragraf, yang mengungkapkan disparitas kinerja signifikan di antara model-model yang diuji.
GLM-5.3 Flash mendekati Claude Opus 4.8 pada benchmark pemrograman
Z.ai mengungkapkan bahwa model yang sebelumnya diuji secara anonim, ox-alpha, adalah GLM-5.3-Flash, sebuah model Mixture of Experts (MoE) dengan 320B parameter dan 18B parameter aktif.
GLM-5.3 menyamai akurasi Claude Fable 5 pada DeepSWE dengan biaya seperlima
Perbandingan GLM-5.3 dan Claude Fable 5 pada benchmark DeepSWE mengungkapkan bahwa meskipun kedua model mencapai akurasi first-shot yang hampir identik (69,0% vs 69,7%), GLM-5.3 jauh lebih hemat biaya dan berkinerja lebih baik dalam skenario multi-percobaan.