Пользователь делится конфигурацией Docker для запуска GLM-5.2-FP8 на оборудовании HGX-H200 с использованием SGLang. Настройка обеспечивает длину контекста 262k и скорость 70 токенов в секунду при параллелизме по тензорам, равном 8, с долей использования памяти 0.83. Пользователь отмечает, что официальные рецепты vLLM не работают на H200 из-за ограничений квантования FP8 для KV-кэша в архитектуре DSV3.
Конфигурация развертывания SGLang в Docker для GLM-5.2-FP8 на HGX-H200
GLM 5.2 Q1_S против Qwen 27B Q8: локальное сравнение LLM
Любительское сравнение на потребительском оборудовании показывает, что сильно квантованная GLM-5.2 (Q1_S) превосходит модель более высокого бита Qwen 3.6 27B (Q8) в сложной задаче программирования, несмотря на значительно более низкую скорость вывода.
Высококачественная квантование GLM-5.2 на 4x DGX Spark: руководство, результаты и сравнения
Автор демонстрирует запуск модели GLM-5.2 NVFP4 на четырех узлах NVIDIA GB10 DGX Spark с контекстным окном 128K, достигая пригодной для использования производительности обслуживания благодаря агрессивной оптимизации системы.
Разрыв и прогресс открытия моделей GLM-5.2
Модель GLM-5.2 от Zhipu стала лучшей открытым весами, похвалена за свою производительность, приближенную к передовым, в повседневном использовании, с улучшением в задачах программирования и сокращением стоимости инференса на 1 млн токенов за счёт IndexShare. Она превзошла другие открытые модели в тестах по агентским задачам, достигнув 1266 Elo в тесте AA-Briefcase от Artificial Analysis, хотя только 3% задач были полностью выполнены лучшими моделями, что указывает на сохраняющиеся трудности в реальных долгосрочных агентских задачах.
GLM-5.2 побеждает Гемини и GPT-5.4 в программировании, но является неэффективным
GLM-5.2 превосходит GPT-5.4 и всю линейку Гемини по производительности в программировании на бенчмарке DeepSWE. Однако он требует значительно большего количества токенов вывода, что делает его существенно менее эффективным с точки зрения затрат на задачу по сравнению с моделями, такими как GPT-5.5 и Claude Opus 4.8.
GLM 5.2 достигает 98% максимальной интеллекта с менее чем половиной токенов
Согласно техническому отчету z_ai, модель GLM 5.2 демонстрирует 98% максимального интеллекта в задачах программирования, используя менее половины своего общего бюджета токенов. Эффективность логического мышления модели значительно улучшилась: количество токенов увеличилось с 16,7 к до 36,7 к при переходе от GLM 5.1 к GLM 5.2, хотя настройки высокого уровня могут негативно сказаться на производительности локальных аппаратных средств.