Пользователь демонстрирует запуск модели Qwen3.6-35B-A3B с квантованием NVFP4 на GPU RTX Pro 6000 Blackwell, достигая совокупной пропускной способности около 2000 токенов в секунду при обработке 30 параллельных потоков генерации подписей к изображениям. Конфигурация использует vLLM с бэкендом внимания FLASHINFER и кэшированием префиксов для управления высокой степенью параллелизма. Архитектура Mixture of Experts (MoE) активирует только около 53-61% экспертов даже при высоких уровнях параллелизма, что позволяет ей превосходить плотные модели, несмотря на большее количество параметров. Эта настройка доказывает, что квантование NVFP4 на оборудовании Blackwell может эффективно обрабатывать мультимодальные рабочие нагрузки с высокой степенью параллелизма без исчерпания VRAM.
NVFP4 Qwen3.6-35B-A3B на Blackwell достигает ~2000 tps при 30 параллельных потоках
Объединённый GGUF и форк llama.cpp обеспечивают поддержку аудио и видео для Nemotron-3-Nano-Omni
Автор рассматривает скрытые сбои в популярных версиях GGUF модели Nemotron-3-Nano-Omni-30B, где входные данные аудио и видео игнорировались из-за неполных файлов проектора и отсутствующих графов вывода. Для исправления этого состояния был выпущен объединённый файл mmproj, содержащий визуальный башню, полнослойный аудиоэнкодер Parakeet/FastConformer и временной видеовстраиватель, а также специализированный форк llama.cpp.
Zero-shot Nemotron 3.5 Lightning Omni добавляет зрение и аудио через геометрическое совпадение
Автор создал Nemotron 3.5 Lightning-Omni, прикрепив предварительно обученные проекторы из NVIDIA’s Nemotron-3-Nano-Omni к текстовой модели Nemotron 3.5 Lightning, что позволяет понимать изображения и аудио без дополнительного обучения.
NVIDIA запускает Qwen 3.8 2.4T на GB300 NVL72 со скоростью 4K токенов/с на GPU
NVIDIA продемонстрировала развертывание модели Qwen 3.8 2.4T с параметрами и настраиваемыми возможностями рассуждения на аппаратной платформе GB300 NVL72.
Microsoft выпустила Mage-VL — потоковую мультимодельную модель с нативным кодеком
Microsoft выпустила Mage-VL, эффективную мультимодельную базовую модель на 4 млрд параметров для понимания изображений и видео, использующую подход с нативным кодеком для оптимизации визуальной обработки. Система разделяет видеопотоки на опорные (I) кадры и предсказанные (P) кадры, сохраняя только те патчи, которым кодек выделяет биты, что снижает потребление визуальных токенов более чем на 75%.
Нетuned Qwen3.6-27B превосходит tuned Nemotron Puzzle-75B в агентных задачах
Оценка агентных возможностей показывает, что нетuned модель Qwen3.6-27B успешно выполнила все протестированные задачи, используя 6-9 вызовов инструментов, тогда как tuned Nemotron Puzzle-75B потребовала ручного подбора промптов и значительно большего количества шагов для прохождения.