NVIDIA发布Alpamayo 2 Super,一款用于自动驾驶的34B开源VLA模型
NVIDIA发布了Alpamayo 2 Super,这是一款在OpenMDW-1.1许可下发布的、专为Robotaxi和自动驾驶设计的340亿参数视觉-语言-动作(VLA)模型。该模型通过结合32B Cosmos 3 Super Reasoner骨干网络与2.3B基于扩散的动作解码器,从多摄像头视频中生成轨迹、因果解释和元动作,以应对长尾事件。
NVIDIA发布了Alpamayo 2 Super,这是一款在OpenMDW-1.1许可下发布的、专为Robotaxi和自动驾驶设计的340亿参数视觉-语言-动作(VLA)模型。该模型通过结合32B Cosmos 3 Super Reasoner骨干网络与2.3B基于扩散的动作解码器,从多摄像头视频中生成轨迹、因果解释和元动作,以应对长尾事件。
研究人员推出了 Video-DeepResearch (Video-DR),这是一个将 multimodal agent 从静态图像扩展到连续视频流的框架,旨在解决模态偏差和参数知识泄漏问题。该系统采用解耦的感知-探索流水线,并通过分阶段解锁工具,在网页检索之前强制实现跨帧视觉定位。
Shieldstral 是一个拥有 3B 参数的开源权重多模态安全分类器,它将内容审核框架化为一个策略自适应的问答任务,使其能够在推理时接受自然语言描述的策略而无需重新训练。它统一了文本和图像的安全评估,并在多个基准测试中提供校准后的安全评分,同时在单张 16GB NVIDIA GPU 上高效运行。
抖音发布了其多模态嵌入(DME)模型的技术报告,该模型结合大规模对比预训练与潜在推理,实现了强大的判别能力和效率。
文章强调了 Qwen3.8-Max 在单次生成(one-shot)评估上下文中的表现,指出其处理复杂物理模拟的能力。
MiniMax已将其MiniMax-H3模型在Hugging Face上开放。这个通用全模态生成系统支持对由文本、图像、视频和音频组成的多模态上下文的统一理解。
Thinking Machines Lab 发布了 Inkling-Small,这是一个拥有 2760 亿总参数和 120 亿激活参数的开放权重混合专家(MoE)模型。该模型能够原生地对文本、图像和音频进行推理,具备 1M token 上下文窗口和可调节的思考力度。
最新的开源模型成果汇总突出了Thinking Machines和腾讯的重大发布,以及Poolside和DeepSeek的更新。
高二学生Hanyu(Olivia)Yu正在寻找cs.LG或cs.CV领域的arXiv推荐人,以上传她独立撰写的预印本《AttnRoute-MoE: Attention-Prior Routing for Mixture-of-Experts Vision Transformers》。
llama.cpp 项目发布了构建版本 b10218,其中通过 pull request #25993 添加了 minicpmv46 下采样支持。此更新引入了一个 4x ignore VIT merger,并将下采样模式置于 GGUF 格式内部。
本期AI新闻汇总涵盖了定价、开放权重模型和机器人基础设施方面的重要进展。OpenAI大幅降低了GPT-5.6的成本,同时Thinking Machines发布了一款紧凑的多模态模型,而Google DeepMind则扩展了其机器人能力。
微软发布了Mage-VL,这是一种高效的4B参数多模态基础模型,用于图像和视频理解,采用编解码器原生的方法来简化视觉处理。该系统将视频流分离为关键帧(I帧)和预测帧(P帧),仅保留编解码器分配比特的补丁,从而将视觉标记的消耗减少超过75%。
NVIDIA的研究人员推出了Spatial-IQ,这是一种旨在解构多模态大语言模型(MLLMs)空间智能的诊断框架。与将模型视为黑盒的现有基准不同,该方法将堆叠3D结构中的物体计数分解为九个与人类发展阶段相一致的感知和认知子任务。
研究人员推出了 ClinFusion,这是一种以视觉为核心的多模态大语言模型,旨在通过统一 2D 和 3D 医学图像理解来解决将 AI 部署到临床实践中的挑战。该系统采用组合式级联视觉编码器,包含 Cascade Spatial-Aware Locality Fusion 算子,并引入了一个由 MedIF-Bench 和基于感兴趣区域(region-of-interest)的指标组成的新评估框架。
研究人员推出了ClinFusion,这是一种以视觉为中心的多模态大语言模型,旨在实现全面的医学理解,统一了2D和本地3D图像分析。该系统利用组合式级联视觉编码器,结合Cascade Spatial-Aware Locality Fusion算子,以应对异质医学成像带来的挑战。
研究人员分析了竞技射击游戏 Delta Force 的游戏视频,以提取和理解新兴的非语言交流,如手势和移动模式。这项工作解决了先前研究的空白,这些研究主要集中于 MOBA 游戏或其他射击游戏中的语音协调。
llama.cpp 项目发布了构建版本 b10142,为 MiniMax-M3 模型引入了初步的视觉支持。此次更新实现了一个仅文本的端口,复用了来自 MiniMax-M2 的现有组件,包括带有每头 QK 归一化和部分旋转编码的 GQA、DeepSeek-V3 风格的专家网络以及 swigluoai 激活函数。
Black Forest Labs 发布了 FLUX 3,这是一种多模态基础模型,能够在单一架构中从图像、视频和音频中学习。它是首款通过一组权重提供视频、音频和动作预测的 FLUX 模型。
Induction Labs发布了Photon-1,这是一种稀疏的106B-A5B混合专家Transformer,它通过从原始视频中预测未来帧(无需动作标签)来学习模拟桌面环境并玩游戏。该模型使用有限标量量化技术将每一帧压缩为960个离散token,在保留文本和布局细节的同时,实现了比现有表示方法高100多倍的压缩率。
FLUX 3 被介绍为一个单一的多模态模型,旨在处理图像、视频、音频和动作预测任务。该系统旨在在各种风格中产生更贴近现实的作品。