A Anthropic publicou um artigo de pesquisa intitulado "GLM-5.3 e a Disseminação de Capacidades Cibernéticas Avançadas", que examina como modelos de código aberto como o GLM-5 são utilizados em atividades cibernéticas maliciosas. O artigo destaca que esses modelos foram amplamente adotados por atores de ameaças, servindo efetivamente como uma propaganda de suas capacidades dentro da comunidade de segurança. Esta análise ressalta a crescente preocupação quanto à natureza de uso duplo dos modelos avançados de IA e seu potencial para amplificar as ameaças cibernéticas.
Pesquisa da Anthropic vincula GLM-5 à disseminação de capacidades cibernéticas avançadas
Anthropic descobre que GLM-5.3 alcança sequestros completos de fluxo de controle em ciberred teaming
O Frontier Red Team da Anthropic avaliou o modelo chinês GLM-5.3 em 100 tarefas de um benchmark interno de Binary Exploitation e descobriu que ele é capaz de desenvolver sequestros completos de fluxo de controle em 4% dos ensaios.
Anthropic analisa GLM-5.3 e a disseminação de capacidades cibernéticas avançadas
A Anthropic publicou um artigo de pesquisa examinando o GLM-5.3 e seu papel na disseminação de capacidades cibernéticas avançadas.
Modelos de fronteira avaliados no jogo de perguntas log(N) sobre a Wikipedia
Um estudo avalia seis modelos de linguagem de fronteira em uma tarefa de comunicação entre dois agentes, na qual um questionador identifica um alvo a partir de N parágrafos da Wikipedia usando exatamente log2(N) perguntas sim/não. O experimento realizou 408 jogos em conjuntos de documentos de 4 a 1024 parágrafos, revelando disparidades significativas de desempenho entre os modelos testados.
GLM-5.3 Flash se aproxima do Claude Opus 4.8 em benchmarks de codificação
A Z.ai revelou que o modelo anteriormente testado anonimamente, ox-alpha, é o GLM-5.3-Flash, um modelo Mixture of Experts (MoE) com 320B de parâmetros e 18B de parâmetros ativos.
GLM-5.3 iguala a precisão do Claude Fable 5 no DeepSWE por um quinto do custo
Uma comparação entre GLM-5.3 e Claude Fable 5 no benchmark DeepSWE revela que, embora ambos os modelos alcancem uma precisão de primeira tentativa quase idêntica (69,0% contra 69,7%), o GLM-5.3 é significativamente mais econômico e tem melhor desempenho em cenários de múltiplas tentativas.