GLM-5.2 — первый открытый модель с весами, достигший точности 80% на Terminal-Bench и превосходящий все другие доступные открытые модели. Он также превосходит Gemini, что делает его моделью передовой категории при значительно более низкой стоимости.
GLM-5.2 превышает 80% на Terminal-Bench
Бенчмарки
| Бенчмарк | Модель | Результат |
|---|---|---|
| Terminal-Bench | GLM-5.2 | 80% |
Z.AI подтверждает, что Ox Alpha — новая модель серии GLM и опубликует веса
Z.AI подтвердила в среду, что модель Ox Alpha является новой итерацией её серии GLM. Компания заявила, что выпустит веса модели позже в тот же день, ответив на запросы Bloomberg News.
Z.ai выпускает GLM-5.3 с расширенным постобучением
Z.ai анонсировала GLM-5.3, новую модель, которая демонстрирует передовые результаты на бенчмарках агентного программирования благодаря расширению этапа постобучения своей базовой модели GLM-5.2. Модель с ~750B параметров в настоящее время превосходит Kimi K3 и сопоставима или превосходит Claude Fable 5 и GPT-5.6-Sol на различных бенчмарках.
Сравнение Kimi K3, DeepSeek V4 Pro и GLM-5.2 по бенчмаркам, лицензии и стоимости обслуживания
Сравнение трёх моделей с открытыми весами на основе разреженного Mixture-of-Experts — Kimi K3 от Moonshot AI, DeepSeek V4 Pro и GLM-5.2 от Zhipu AI — оценивает их возможности, условия лицензирования и стоимость обслуживания для задач программирования и работы агентов с длинным горизонтом.
Человеческая оценка показывает, что GLM-5.2 конкурирует с лучшими моделями
Человеческая оценка на лидерборде Design Arena показывает, что GLM-5.2 демонстрирует почти такое же качество, как Fable 5 в задачах разработки игр, занимая лишь одну ступень ниже. Модель, основанная на открытых весах и лицензии MIT, оценивается как равнозначная по возможностям лучшим доступным моделям Claude, что указывает на то, что стандартизированные бенчмарки могут уже не отражать реальную производительность.
GLM-5.2 — новый лучший открытый модель
GLM-5.2 достигает результатов на тестах, близких к передовым уровням, сопоставимых с Opus 4.7 в задачах только с текстом и занимающих одно из ведущих мест среди открытых моделей на нескольких тестах. Это сильнейшая открытая модель, доступная в настоящее время, превосходящая предшественники и конкурентов, таких как GPT-5.5 и Fable, хотя она не достигает высоких результатов на специализированных тестах, таких как сопротивление сихофаническим тенденциям, и имеет ограниченные возможности в области зрения.