Автор успешно развернул GLM-5.2 со спекулятивным декодированием MTP на кластере из четырех узлов NVIDIA GB10 (DGX Spark), достигнув скорости около 9,4 токенов в секунду. Эта конфигурация использует vLLM с тензорным параллелизмом, портированные ядра Triton для разреженного MLA и детерминированное отсечение 15% экспертов для размещения весов AWQ-INT4. Ключевым выводом стало то, что исходные инструкции по сборке Docker-образа неполны, что требует восстановления недостающих патчей для файлов deep_gemm.py и sparse_attn_indexer.py. Автор также выявил, что использование любой версии vLLM, отличной от конкретного зафиксированного коммита, приводит к падению загрузки реальных весов AWQ из-за ошибок CUDA. Для воспроизведения среды пользователям необходимо применить пользовательский скрипт, который внедряет ядра и маршрутизирует функции в fallback-решения для sm12x. Преимущества производительности включают примерно двукратное увеличение скорости по сравнению с предыдущими реализациями llama.cpp, хотя пропускная способность между узлами остается узким местом для масштабирования с использованием двойных шин (dual-rail).
GLM-5.2 на 4x DGX Spark: Восстановление недостающих шагов сборки для MTP спекулятивного декодирования
llama.cpp добавляет поддержку NVIDIA Nemotron-3-Puzzle-75B-A9B
llama.cpp вводит поддержку модели NVIDIA Nemotron-3-Puzzle-75B-A9B, обеспечивая вывод для этой архитектуры Mixture of Experts. Обновление реализует инфраструктуру для переменных размеров feed-forward экспертов на слой и маршрутизации top-k, что необходимо, поскольку модель имеет 40 слоев MoE с различными значениями n_ff_exp и top-k.
NVIDIA покупает HuggingFace за $13 млрд; Z.ai запускает GLM-5.3-Flash
Nvidia приобретает HuggingFace за 13 миллиардов долларов, что почти вдвое превышает её первоначальное предложение от января 2026 года, поскольку платформа удваивает свою клиентскую базу в 2026 году. Одновременно с этим Z.ai официально запустила GLM-5.3-Flash, нативно мультимодельную модель с открытыми весами, ранее известную как Ox Alpha.
LordNeel выпустил GGUF-квантования для Tencent Hy3 и NVIDIA Nemotron-Labs-Audex
LordNeel опубликовал наборы квантования GGUF для модели MoE Hy3 от Tencent объёмом 295B и аудио-способной гибридной модели MoE Nemotron-Labs-Audex-30B-A3B от NVIDIA объёмом 30B, предоставив полные данные бенчмарков и воспроизводимые метрики.
NVIDIA выпустила сжатую модель Nemotron Puzzle-75B-A9B с двукратным увеличением пропускной способности
Компания NVIDIA выпустила модель Nemotron-Labs-3-Puzzle-75B-A9B, крупную языковую модель, оптимизированную для развертывания и полученную из Nemotron-3-Super-120B-A12B. Она использует фреймворк сжатия постобучения Iterative Puzzle для значительного повышения эффективности вывода при задачах, требующих рассуждений и длинного контекста, сохраняя при этом высокую точность в downstream-задачах.
NVIDIA выпустила модель Qwen3.6-27B-NVFP4
NVIDIA выпустила модель Qwen3.6-27B-NVFP4 на Hugging Face.