GLM-5.2 прошёл проверку на атмосферу как передовая открытая модель, получив похвалу от Джереми Ховарда и превзойдя GPT-5.5 на новом бенчмарке по искусственному анализу, разработанном Artificial Analysis. Модель также получила подтверждение от сообщества /r/LocalLlama, что указывает на сильную практическую полезность и производительность.
GLM-5.2 прошёл проверку на атмосферу, превзошёл GPT-5.5
GLM-5.3 делит с Fable 5 и GPT-5.6 Sol первое место на SlopCodeBench
GLM-5.3 набрал 10 из 30 баллов (33,3%) в бенчмарке SlopCodeBench, разделив первое место с Fable 5 и GPT-5.6 Sol в подмножестве из шести задач.
Бенчмарки Databricks для кодовых агентов: pi-coding-agent дешевле, GLM 5.2 соответствует Opus
Databricks опубликовала бенчмарк кодовых агентов на своей многомиллионной кодовой базе, сообщив, что её внутренний pi-coding-agent до 2 раз дешевле Claude Code или Codex при этом демонстрируя более высокие показатели успешности. Исследование также показало, что GLM 5.2 работает на уровне с Opus 4.8 high и превосходит GPT 5.5 high и xhigh.
GLM 5.2 справляется с задачей CV для нескольких файлов благодаря согласованному планированию и самопроверке
Пользователь протестировал GLM 5.2 на сложной задаче реализации компьютерного зрения (CV) с несколькими файлами, чтобы оценить его возможности уровня production за пределами результатов бенчмарков. Модель успешно создала браузерную студию CV, включающую обнаружение объектов, персистентное отслеживание и бэкенд на FastAPI, продемонстрировав сильное архитектурное планирование и согласованность.
DeepSeek V4 Pro 0813 против Claude Fable 5 на DeepSWE: стоимость, программирование и маршрутизация
Сравнение моделей DeepSeek V4 Pro 0813 и Claude Fable 5 по бенчмарку DeepSWE показывает, что стратегия маршрутизации с использованием обеих моделей решает 82,7% задач при стоимости $8,28 за каждую, превосходя использование только Fable (69,7%) и будучи значительно дешевле.
DeepSeek V4 Pro и GPT-5.6 Sol: каскадное решение 83% задач DeepSWE за $3,35
Сравнение моделей DeepSeek V4 Pro 0813 и GPT-5.6 Sol на бенчмарке DeepSWE показывает, что запуск DeepSeek с последующим переходом к GPT-5.6 Sol при неудачном прохождении теста обеспечивает результативность 83,0% при стоимости $3,35 за задачу.