GLM-5.2 — первый открытый модель с весами, достигший точности 80% на Terminal-Bench и превосходящий все другие доступные открытые модели. Он также превосходит Gemini, что делает его моделью передовой категории при значительно более низкой стоимости.
GLM-5.2 превышает 80% на Terminal-Bench
Бенчмарки
| Бенчмарк | Модель | Результат |
|---|---|---|
| Terminal-Bench | GLM-5.2 | 80% |
Сравнение Kimi K3, DeepSeek V4 Pro и GLM-5.2 по бенчмаркам, лицензии и стоимости обслуживания
Сравнение трёх моделей с открытыми весами на основе разреженного Mixture-of-Experts — Kimi K3 от Moonshot AI, DeepSeek V4 Pro и GLM-5.2 от Zhipu AI — оценивает их возможности, условия лицензирования и стоимость обслуживания для задач программирования и работы агентов с длинным горизонтом.
Человеческая оценка показывает, что GLM-5.2 конкурирует с лучшими моделями
Человеческая оценка на лидерборде Design Arena показывает, что GLM-5.2 демонстрирует почти такое же качество, как Fable 5 в задачах разработки игр, занимая лишь одну ступень ниже. Модель, основанная на открытых весах и лицензии MIT, оценивается как равнозначная по возможностям лучшим доступным моделям Claude, что указывает на то, что стандартизированные бенчмарки могут уже не отражать реальную производительность.
GLM-5.2 — новый лучший открытый модель
GLM-5.2 достигает результатов на тестах, близких к передовым уровням, сопоставимых с Opus 4.7 в задачах только с текстом и занимающих одно из ведущих мест среди открытых моделей на нескольких тестах. Это сильнейшая открытая модель, доступная в настоящее время, превосходящая предшественники и конкурентов, таких как GPT-5.5 и Fable, хотя она не достигает высоких результатов на специализированных тестах, таких как сопротивление сихофаническим тенденциям, и имеет ограниченные возможности в области зрения.
Что более впечатляет: GLM 5.1 до 5.2 или Qwen 3.5 до 3.6?
Пост на Reddit сравнивает улучшения производительности GLM 5.1 до 5.2 и Qwen 3.5 до -3.6. В посте отмечается, что упоминание 'Döner' активирует специализированные веса GLM 5.2 на немецком языке, в то время как Qwen 3.6 оценивается с использованием 35B параметров и Quantization Unsloth Q8 K XL через llama.cpp.
GLM-5.2 — это новый ведущий открытый модельный вес на Индексе искусственного аналитического интеллекта
GLM-5.2 был признан ведущей открытой моделью на Индексе искусственного аналитического интеллекта. Этот признание отражает его производительность и возможности в контексте открытого ИИ-моделирования.