Z.ai выпустила GLM-5.3-Flash, первую нативно мультимодальную модель в серии GLM-5, использующую архитектуру mixture-of-experts с общим количеством параметров 320 миллиардов и 18 миллиардами активных на токен. Модель поддерживает ввод изображений и видео в окне контекста длиной 1 048 576 токенов и доступна по лицензии MIT на Hugging Face.

  • Она использует гибридное внимание, сочетающее слои линейного внимания KDA со слоями разреженного MLA NoPE, маршрутизируя токены через 8 из 288 экспертов.
  • Механизм IndexPool снижает вычислительную нагрузку внимания примерно в 3 раза и уменьшает размер KV-кэша в 4,4 раза по сравнению с GLM-5.3.
  • Результаты бенчмарков показывают 84,3 балла на Terminal-Bench 2.1 и 63,4 на DeepSWE v1.1, что сопоставимо с результатами Claude Opus 4.8.
  • Цена API составляет $0,15/M за входные токены и $0,50/M за выходные токены; для самостоятельного размещения требуется около 306 ГБ весов в формате FP8.

Модель призвана обеспечить экономически эффективное решение для программирования, превосходя GLM-5.2 по бенчмаркам примерно при одной десятой стоимости, сохраняя высокую производительность во внутренних задачах кодирования.