一名用户演示了在RTX Pro 6000 Blackwell GPU上运行经过NVFP4量化的Qwen3.6-35B-A3B模型,在处理30个并发的图像描述生成流时,实现了大约每秒2000个令牌的总吞吐量。 该配置利用vLLM配合FLASHINFER注意力后端和前缀缓存来管理高并发。混合专家(MoE)架构即使在高水平并发下也仅激活约53-61%的专家,使其尽管参数量更大,仍能超越密集模型。 此设置证明了Blackwell硬件上的NVFP4量化可以高效处理具有显著并行度的多模态工作负载,而不会耗尽VRAM。
media
r/LocalLLaMA
·
51 天前
·
open_models
Blackwell上的NVFP4 Qwen3.6-35B-A3B在30个并发流下实现约2000 tps
译自 English → 中文
相关文章
media
Hugging Face Forums
·
1 小时前
实时
统一的 GGUF 和 llama.cpp 分支为 Nemotron-3-Nano-Omni 启用音频和视频功能
作者解决了 Nemotron-3-Nano-Omni-30B 的流行 GGUF 版本中存在的静默失败问题,由于投影器文件不完整且推理图缺失,导致音频和视频输入被忽略。为解决此问题,已发布一个包含视觉塔、完整的 Parakeet/FastConformer 音频编码器和时序视频嵌入器的统一 mmproj 文件,以及一个专门的 llama.cpp 分支。
media
Hugging Face Forums
·
1 小时前
实时
零样本 Nemotron 3.5 Lightning Omni 通过几何匹配添加视觉和音频能力
作者通过将 NVIDIA 的 Nemotron-3-Nano-Omni 的预训练投影器附加到仅文本的 Nemotron 3.5 Lightning 模型,创建了 Nemotron 3.5 Lightning-Omni,无需任何额外训练即可实现图像和音频理解。
media
r/LocalLLaMA
·
8 天前
·
16 次浏览
NVIDIA在GB300 NVL72上以每GPU 4K tok/s的速度服务Qwen 3.8 2.4T
NVIDIA展示了在其GB300 NVL72硬件平台上提供具有可配置推理能力的Qwen 3.8 2.4T参数模型。
media
r/LocalLLaMA
·
27 天前
·
16 次浏览
微软发布Mage-VL,一种基于编解码器的原生流式多模态模型
微软发布了Mage-VL,这是一种高效的4B参数多模态基础模型,用于图像和视频理解,采用编解码器原生的方法来简化视觉处理。该系统将视频流分离为关键帧(I帧)和预测帧(P帧),仅保留编解码器分配比特的补丁,从而将视觉标记的消耗减少超过75%。
media
r/LocalLLaMA
·
46 天前
·
4 次浏览
未调优的 Qwen3.6-27B 在代理任务中优于调优后的 Nemotron Puzzle-75B
对代理能力的评估显示,未调优的 Qwen3.6-27B 模型成功完成了所有测试任务,使用了 6-9 次工具调用,而调优后的 Nemotron Puzzle-75B 需要手动调优的提示词和显著更多的轮次才能通过。