Автор успешно развернул GLM-5.2 со спекулятивным декодированием MTP на кластере из четырех узлов NVIDIA GB10 (DGX Spark), достигнув скорости около 9,4 токенов в секунду. Эта конфигурация использует vLLM с тензорным параллелизмом, портированные ядра Triton для разреженного MLA и детерминированное отсечение 15% экспертов для размещения весов AWQ-INT4. Ключевым выводом стало то, что исходные инструкции по сборке Docker-образа неполны, что требует восстановления недостающих патчей для файлов deep_gemm.py и sparse_attn_indexer.py. Автор также выявил, что использование любой версии vLLM, отличной от конкретного зафиксированного коммита, приводит к падению загрузки реальных весов AWQ из-за ошибок CUDA. Для воспроизведения среды пользователям необходимо применить пользовательский скрипт, который внедряет ядра и маршрутизирует функции в fallback-решения для sm12x. Преимущества производительности включают примерно двукратное увеличение скорости по сравнению с предыдущими реализациями llama.cpp, хотя пропускная способность между узлами остается узким местом для масштабирования с использованием двойных шин (dual-rail).
GLM-5.2 на 4x DGX Spark: Восстановление недостающих шагов сборки для MTP спекулятивного декодирования
LordNeel выпустил GGUF-квантования для Tencent Hy3 и NVIDIA Nemotron-Labs-Audex
LordNeel опубликовал наборы квантования GGUF для модели MoE Hy3 от Tencent объёмом 295B и аудио-способной гибридной модели MoE Nemotron-Labs-Audex-30B-A3B от NVIDIA объёмом 30B, предоставив полные данные бенчмарков и воспроизводимые метрики.
NVIDIA выпустила сжатую модель Nemotron Puzzle-75B-A9B с двукратным увеличением пропускной способности
Компания NVIDIA выпустила модель Nemotron-Labs-3-Puzzle-75B-A9B, крупную языковую модель, оптимизированную для развертывания и полученную из Nemotron-3-Super-120B-A12B. Она использует фреймворк сжатия постобучения Iterative Puzzle для значительного повышения эффективности вывода при задачах, требующих рассуждений и длинного контекста, сохраняя при этом высокую точность в downstream-задачах.
NVIDIA выпустила модель Qwen3.6-27B-NVFP4
NVIDIA выпустила модель Qwen3.6-27B-NVFP4 на Hugging Face.
GLM-5.2 NVFP4 на четырех DGX Spark — загадка MTP разгадана, теперь ~24 ток/с при контексте 128K
Дополнительное исследование работы GLM-5.2 NVFP4 на четырех узлах DGX Spark устраняет предыдущую проблему с производительностью, когда высокие коэффициенты принятия были невозможны при контексте 128K.
Высококачественная квантование GLM-5.2 на 4x DGX Spark: руководство, результаты и сравнения
Автор демонстрирует запуск модели GLM-5.2 NVFP4 на четырех узлах NVIDIA GB10 DGX Spark с контекстным окном 128K, достигая пригодной для использования производительности обслуживания благодаря агрессивной оптимизации системы.