Компания NVIDIA выпустила модель Nemotron-TwoTower-30B-A3B-Base-BF16, построенную на базе Nemotron 3 Nano 30B-A3B. Эта архитектура отличается от стандартных авторегрессионных моделей за счет использования замороженной контекстной башни вместе с башней диффузионного шумоподавления. Система итеративно заполняет блоки токенов параллельно, а не генерирует их строго по одному. По словам NVIDIA, эта настройка маски-диффузии по умолчанию сохраняет 98,7% совокупного качества бенчмарков, характерного для авторегрессионной базовой модели. При сохранении высокого качества модель достигает в 2,42 раза большей пропускной способности генерации во времени выполнения. В релизе подчеркивается новый подход к языковому моделированию, сочетающий техники диффузии с возможностями больших языковых моделей.
NVIDIA выпустила Nemotron-TwoTower-30B-A3B — языковую модель на основе диффузии
llama.cpp добавляет поддержку NVIDIA Nemotron-3-Puzzle-75B-A9B
llama.cpp вводит поддержку модели NVIDIA Nemotron-3-Puzzle-75B-A9B, обеспечивая вывод для этой архитектуры Mixture of Experts. Обновление реализует инфраструктуру для переменных размеров feed-forward экспертов на слой и маршрутизации top-k, что необходимо, поскольку модель имеет 40 слоев MoE с различными значениями n_ff_exp и top-k.
LordNeel выпустил GGUF-квантования для Tencent Hy3 и NVIDIA Nemotron-Labs-Audex
LordNeel опубликовал наборы квантования GGUF для модели MoE Hy3 от Tencent объёмом 295B и аудио-способной гибридной модели MoE Nemotron-Labs-Audex-30B-A3B от NVIDIA объёмом 30B, предоставив полные данные бенчмарков и воспроизводимые метрики.
NVIDIA выпустила сжатую модель Nemotron Puzzle-75B-A9B с двукратным увеличением пропускной способности
Компания NVIDIA выпустила модель Nemotron-Labs-3-Puzzle-75B-A9B, крупную языковую модель, оптимизированную для развертывания и полученную из Nemotron-3-Super-120B-A12B. Она использует фреймворк сжатия постобучения Iterative Puzzle для значительного повышения эффективности вывода при задачах, требующих рассуждений и длинного контекста, сохраняя при этом высокую точность в downstream-задачах.
NVIDIA выпустила модель Qwen3.6-27B-NVFP4
NVIDIA выпустила модель Qwen3.6-27B-NVFP4 на Hugging Face.
GLM-5.2 на 4x DGX Spark: Восстановление недостающих шагов сборки для MTP спекулятивного декодирования
Автор успешно развернул GLM-5.2 со спекулятивным декодированием MTP на кластере из четырех узлов NVIDIA GB10 (DGX Spark), достигнув скорости около 9,4 токенов в секунду. Эта конфигурация использует vLLM с тензорным параллелизмом, портированные ядра Triton для разреженного MLA и детерминированное отсечение 15% экспертов для размещения весов AWQ-INT4. Ключевым выводом стало то, что исходные инструкции по сборке Docker-образа неполны, что требует восстановления недостающих патчей для файлов deep_gemm.py и sparse_attn_indexer.py. Автор также выявил, что использование любой версии vLLM, отличной от конкретного зафиксированного коммита, приводит к падению загрузки реальных весов AWQ из-за ошибок CUDA. Для воспроизведения среды пользователям необходимо применить пользовательский скрипт, который внедряет ядра и маршрутизирует функции в fallback-решения для sm12x. Преимущества производительности включают примерно двукратное увеличение скорости по сравнению с предыдущими реализациями llama.cpp, хотя пропускная способность между узлами остается узким местом для масштабирования с использованием двойных шин (dual-rail).