GLM-5.2, открытая модель ИИ, выпущенная Z.ai, установила новый уровень в программировании и общих показателях работы агентов. Она превосходит модели, такие как Claude Fable 5 и Gemini, и достигает или превосходит OpenAI's Opus 4.8 в режиме максимального мышления, становясь первым открытым моделью, которая чувствует себя естественно в программных средах как общий агент.
GLM-5.2 — шаг вперёд для открытых агентов
Z.ai выпустила GLM-5.3 с улучшенным программированием и кибербезопасностью благодаря постобучению
Z.ai выпустила GLM-5.3, обновление своей модели на 743B параметров, которое достигает повышения производительности за счет масштабированного постобучения, а не переобучения базовой модели. Выпуск в настоящее время доступен через API Z.ai, план GLM Coding и ZCode; публичные веса запланированы к выпуску примерно через две недели после запуска после проведения оценок безопасности.
xAI запускает Build Mode; исследователи призывают к соглашению о замедлении развития ИИ
xAI запустила «Build Mode» для подписчиков SuperGrok Heavy, позволяя пользователям создавать, редактировать, просматривать и публиковать веб-сайты, приложения, игры и панели мониторинга непосредственно из чата без предварительной настройки. Одновременно более тысячи сотрудников компаний, разрабатывающих передовой ИИ, подписали заявление с просьбой к правительству США поддержать международные усилия по разработке инструментов для целенаправленного замедления развития передового автоматизированного ИИ.
ZCode: новый агентный редактор кода от создателей GLM
Создатели GLM выпустили ZCode, новый агентный редактор кода. Инструмент доступен по адресу zcode.z.ai.
Qwen3.6-27B с использованием 3 критиков достигает уровня передовых моделей
Пользователь протестировал Qwen3.6-27B (8-bit) вместе с GLM5.2, используя инструмент для написания кода, который применяет трех критиков — проверку кода, проверку тестов и Playwright e2e — для оценки качества вывода.
Разрыв и прогресс открытия моделей GLM-5.2
Модель GLM-5.2 от Zhipu стала лучшей открытым весами, похвалена за свою производительность, приближенную к передовым, в повседневном использовании, с улучшением в задачах программирования и сокращением стоимости инференса на 1 млн токенов за счёт IndexShare. Она превзошла другие открытые модели в тестах по агентским задачам, достигнув 1266 Elo в тесте AA-Briefcase от Artificial Analysis, хотя только 3% задач были полностью выполнены лучшими моделями, что указывает на сохраняющиеся трудности в реальных долгосрочных агентских задачах.