Z.ai выпустила GLM-5.3-Flash, первую нативно мультимодальную модель в серии GLM-5, использующую архитектуру mixture-of-experts с общим количеством параметров 320 миллиардов и 18 миллиардами активных на токен. Модель поддерживает ввод изображений и видео в окне контекста длиной 1 048 576 токенов и доступна по лицензии MIT на Hugging Face.
- Она использует гибридное внимание, сочетающее слои линейного внимания KDA со слоями разреженного MLA NoPE, маршрутизируя токены через 8 из 288 экспертов.
- Механизм IndexPool снижает вычислительную нагрузку внимания примерно в 3 раза и уменьшает размер KV-кэша в 4,4 раза по сравнению с GLM-5.3.
- Результаты бенчмарков показывают 84,3 балла на Terminal-Bench 2.1 и 63,4 на DeepSWE v1.1, что сопоставимо с результатами Claude Opus 4.8.
- Цена API составляет $0,15/M за входные токены и $0,50/M за выходные токены; для самостоятельного размещения требуется около 306 ГБ весов в формате FP8.
Модель призвана обеспечить экономически эффективное решение для программирования, превосходя GLM-5.2 по бенчмаркам примерно при одной десятой стоимости, сохраняя высокую производительность во внутренних задачах кодирования.