Anthropic опубликовала исследовательскую статью под названием «GLM-5.3 и распространение передовых кибервозможностей», в которой рассматривается, как открытые модели, такие как GLM-5, используются в злонамеренной кибердеятельности. В статье отмечается, что эти модели получили широкое распространение среди злоумышленников, фактически служа рекламой их возможностей для сообщества специалистов по безопасности. Этот анализ подчеркивает растущую обеспокоенность по поводу двойственного характера передовых моделей ИИ и их потенциала усиливать киберугрозы.
Исследование Anthropic связывает GLM-5 с распространением передовых кибервозможностей
Anthropic обнаружила, что GLM-5.3 осуществляет полный перехват управления потоком при киберкрасной команде
Команда Frontier Red Team компании Anthropic оценивала китайскую модель GLM-5.3 на 100 задачах из внутреннего бенчмарка Binary Exploitation и обнаружила, что она способна разрабатывать полный перехват управления потоком в 4% испытаний.
Anthropic анализирует GLM-5.3 и распространение передовых кибервозможностей
Anthropic опубликовала исследовательскую статью, посвященную GLM-5.3 и ее роли в распространении передовых кибервозможностей.
Модели уровня Frontier оцениваются в игре log(N)-вопросов по Википедии
Исследование оценивает шесть языковых моделей уровня Frontier в задаче коммуникации двух агентов, где отвечающий на вопросы определяет цель из N абзацев Википедии, используя ровно log2(N) вопросов с ответами «да»/«нет». Эксперимент провёл 408 игр на наборах документов от 4 до 1024 абзацев, выявив значительные различия в производительности среди протестированных моделей.
GLM-5.3 Flash приближается к Claude Opus 4.8 на бенчмарках по программированию
Z.ai объявила, что ранее протестированная анонимно модель ox-alpha — это GLM-5.3-Flash, модель Mixture of Experts (MoE) с 320B параметров и 18B активных параметров.
GLM-5.3 достигает точности Claude Fable 5 на DeepSWE при стоимости в пять раз ниже
Сравнение GLM-5.3 и Claude Fable 5 на бенчмарке DeepSWE показывает, что хотя обе модели демонстрируют практически идентичную точность первого ответа (69,0% против 69,7%), GLM-5.3 значительно более экономична и лучше справляется в сценариях с несколькими попытками.