GLM-5.2 ha superado una 'prueba de vibes' como modelo abierto de vanguardia, recibiendo elogios de Jeremy Howard y superando a GPT-5.5 en el nuevo benchmark de trabajo de conocimiento de Artificial Analysis. También obtuvo la validación de la comunidad /r/LocalLlama, lo que indica una utilidad y rendimiento sólidos en el mundo real.
GLM-5.2 supera la prueba de vibes y supera a GPT-5.5
GLM-5.3 empata con Fable 5 y GPT-5.6 Sol en SlopCodeBench
GLM-5.3 logró una puntuación de 10 de 30 (33,3%) en la prueba de referencia SlopCodeBench, empatando con Fable 5 y GPT-5.6 Sol en el subconjunto de seis problemas.
Benchmarks de Databricks para agentes de código: pi-coding-agent más barato, GLM 5.2 iguala a Opus
Databricks publicó un benchmark de agentes de código en su base de código de varios millones de líneas, informando que su agente interno pi-coding-agent es hasta 2 veces más barato que Claude Code o Codex mientras logra tasas de aprobación más altas. El estudio también encontró que GLM 5.2 se desempeña al mismo nivel que Opus 4.8 high y supera a GPT 5.5 high y xhigh.
GLM 5.2 maneja la tarea de CV multiarchivo con planificación coherente y autoverificación
Un usuario probó GLM 5.2 en una tarea compleja de implementación de visión por computadora (CV) con múltiples archivos para evaluar sus capacidades de nivel de producción más allá de las puntuaciones de benchmarks. El modelo construyó con éxito un estudio de CV basado en navegador que involucraba detección de objetos, seguimiento persistente y un backend con FastAPI, demostrando una sólida planificación arquitectónica y consistencia.
DeepSeek V4 Pro 0813 vs Claude Fable 5 en DeepSWE: Costo, codificación y enrutamiento
Una comparación de DeepSeek V4 Pro 0813 y Claude Fable 5 en el benchmark DeepSWE revela que una estrategia de enrutamiento que utiliza ambos modelos resuelve el 82,7 % de las tareas a $8,28 cada una, superando a Fable por sí solo (69,7 %) mientras es significativamente más económica.
DeepSeek V4 Pro y GPT-5.6 Sol: la cascada resuelve el 83% de las tareas de DeepSWE por $3.35
Una comparación entre DeepSeek V4 Pro 0813 y GPT-5.6 Sol en el benchmark DeepSWE demuestra que ejecutar primero a DeepSeek y escalar a GPT-5.6 Sol ante un fallo en la prueba logra una tasa de éxito del 83,0% por $3.35 por tarea.