Anthropic publicó un artículo de investigación titulado "GLM-5.3 y la propagación de capacidades cibernéticas avanzadas", que examina cómo los modelos de código abierto como GLM-5 se utilizan en actividades cibernéticas maliciosas. El artículo destaca que estos modelos han sido ampliamente adoptados por actores de amenazas, sirviendo efectivamente como una publicidad de sus capacidades dentro de la comunidad de seguridad. Este análisis subraya la creciente preocupación sobre la naturaleza de doble uso de los modelos avanzados de IA y su potencial para amplificar las ciberamenazas.
La investigación de Anthropic vincula GLM-5 con la propagación de capacidades cibernéticas avanzadas
Anthropic descubre que GLM-5.3 logra secuestros completos del flujo de control en ciberred teaming
El Frontier Red Team de Anthropic evaluó el modelo chino GLM-5.3 en 100 tareas de un benchmark interno de Binary Exploitation y descubrió que es capaz de desarrollar secuestros completos del flujo de control en el 4% de los ensayos.
Anthropic analiza GLM-5.3 y la difusión de capacidades cibernéticas avanzadas
Anthropic ha publicado un artículo de investigación que examina GLM-5.3 y su papel en la diseminación de capacidades cibernéticas avanzadas.
Modelos de vanguardia evaluados en el juego de preguntas log(N) sobre Wikipedia
Un estudio evalúa seis modelos de lenguaje de vanguardia en una tarea de comunicación entre dos agentes donde un interrogador identifica un objetivo a partir de N párrafos de Wikipedia utilizando exactamente log2(N) preguntas de sí/no. El experimento ejecutó 408 juegos en conjuntos de documentos de 4 a 1024 párrafos, revelando disparidades significativas en el rendimiento entre los modelos evaluados.
GLM-5.3 Flash se acerca a Claude Opus 4.8 en benchmarks de codificación
Z.ai reveló que el modelo previamente probado de forma anónima ox-alpha es GLM-5.3-Flash, un modelo Mixture of Experts (MoE) de 320B parámetros con 18B parámetros activos.
GLM-5.3 iguala la precisión de Claude Fable 5 en DeepSWE con una quinta parte del costo
Una comparación entre GLM-5.3 y Claude Fable 5 en el benchmark DeepSWE revela que, aunque ambos modelos logran una precisión de primer intento casi idéntica (69,0 % frente a 69,7 %), GLM-5.3 es significativamente más rentable y tiene un mejor desempeño en escenarios de múltiples intentos.