Zhipu AI выпустила GLM-5.3-Flash, первую нативно мультимодальную модель в серии GLM-5 и первый релиз архитектуры glm5_next с открытыми весами. Модель с 320B параметров обучена на 30T-токенном мультимодальном корпусе и использует гибридный механизм внимания, сочетающий разреженность и линейность, для снижения затрат на обслуживание длинного контекста.
- Архитектура: 45 слоёв, объединяющих линейное внимание KDA с разреженным вниманием в стиле DeepSeek, использующих Manifold-Constrained Hyper-Connections (mHC) для эффективности масштабирования.
- Мультимодальные возможности: 24-слойный кодировщик ViT позволяет включать токены изображений и видео в словарь, поддерживая длину контекста до 1,048,576 токенов.
- Веса: Доступны в форматах FP8 (e4m3) и BF16 на Hugging Face и ModelScope под лицензией MIT.
- Поддержка вывода: Официальные рецепты предоставлены для vLLM и SGLang, включая конфигурации спекулятивного декодирования.
Релиз призван предложить экономичную альтернативу, приближающуюся по производительности к Claude Opus 4.8 на задачах программирования и агентов, при этом значительно снижая затраты на вывод.