Anthropic a publié un article de recherche intitulé « GLM-5.3 et la propagation de capacités cybernétiques avancées », qui examine comment les modèles open-source comme GLM-5 sont utilisés dans des activités cybernétiques malveillantes. L'article souligne que ces modèles ont été largement adoptés par les acteurs de la menace, servant efficacement de publicité pour leurs capacités au sein de la communauté de la sécurité. Cette analyse met en évidence l'inquiétude croissante concernant la nature à double usage des modèles d'IA avancés et leur potentiel d'amplification des menaces cybernétiques.
La recherche d'Anthropic relie GLM-5 à la propagation de capacités cybernétiques avancées
Anthropic découvre que GLM-5.3 réalise des hijacks complets du flux de contrôle en cyber red teaming
Le Frontier Red Team d'Anthropic a évalué le modèle chinois GLM-5.3 sur 100 tâches d'un benchmark interne de Binary Exploitation et a découvert qu'il est capable de développer des hijacks complets du flux de contrôle dans 4% des essais.
Anthropic analyse GLM-5.3 et la propagation des capacités cybernétiques avancées
Anthropic a publié un article de recherche examinant GLM-5.3 et son rôle dans la dissémination de capacités cybernétiques avancées.
Modèles de pointe évalués sur le jeu de questions log(N) sur Wikipédia
Une étude évalue six modèles de langage de pointe sur une tâche de communication à deux agents où un questionneur identifie une cible parmi N paragraphes de Wikipédia en utilisant exactement log2(N) questions par oui ou par non. L'expérience a déroulé 408 jeux sur des ensembles de documents allant de 4 à 1024 paragraphes, révélant d'importantes disparités de performance parmi les modèles testés.
GLM-5.3 Flash se rapproche de Claude Opus 4.8 sur les benchmarks de codage
Z.ai a révélé que le modèle précédemment testé anonymement, ox-alpha, est GLM-5.3-Flash, un modèle Mixture of Experts (MoE) avec 320B de paramètres et 18B de paramètres actifs.
GLM-5.3 égale la précision de Claude Fable 5 sur DeepSWE pour un cinquième du coût
Une comparaison entre GLM-5.3 et Claude Fable 5 sur le benchmark DeepSWE révèle que, bien que les deux modèles atteignent une précision au premier essai quasi identique (69,0 % contre 69,7 %), GLM-5.3 est nettement plus rentable et offre de meilleures performances dans les scénarios à multiples tentatives.