ROSA通过共享GPU池服务将工厂生产力提升高达12.06倍
研究人员提出了ROSA,这是一种面向机器人工厂的机器人基础模型推理系统,突破了单机器人、边缘计算的假设。该系统利用共享GPU池服务,使机器人群体能够通过网络访问服务器级GPU。
研究人员提出了ROSA,这是一种面向机器人工厂的机器人基础模型推理系统,突破了单机器人、边缘计算的假设。该系统利用共享GPU池服务,使机器人群体能够通过网络访问服务器级GPU。
Calibra v0.7.1 引入了一个新的数据集完整性(Dataset Integrity)阶段,该阶段在质量和覆盖率分析之前运行,帮助用户验证其机器人数据集是否可靠。
Google DeepMind 发布了 Gemini Robotics 2,这是一个由三个模型组成的智能层,旨在实现全身控制、五指灵巧操作以及多机器人协作。此次发布包括一个视觉-语言-动作(VLA)模型、一个具身推理 VLM 和一个端侧 VLA,突破了以往仅局限于桌面操作的能力。
Google推出了Gemini Robotics 2,这是一个智能层,旨在为适应性机器人提供智能的全身控制、高级灵巧性以及团队协作能力。此次更新将物理AI的能力扩展到狭窄、重复的任务之外,使机器人能够通过推理进行运动并快速适应新身体。
Google 推出了 Gemini Robotics ER 2,这是一款新的具身推理模型,旨在帮助机器人在实时环境中快速思考并规划多步骤任务。此次更新相比之前的 ER 1.6 版本带来了显著升级,包括基于视频的连续进度跟踪、精确的时刻定位以及原生多机器人协作能力。
Calibra 是一个开源工具包,旨在审计机器人数据集并在训练前识别质量问题。它提供了构建质量感知核心集和估计训练结果的工具。
Calibra 是一个开源工具包,旨在帮助研究人员在训练策略之前审计机器人数据集并识别质量问题。首次公开发布包括一个用于审计 LeRobot 数据集的 Robot Dataset Health Check 交互式 Space,以及包含健康评分的 30 个公开 LeRobot 数据集的基准测试。
匹兹堡大学的人机工程学研究实验室(HERL)正在主导“为残疾人提供独立性的机器人辅助移动与操作平台”(RAMMP)项目,该项目获得了ARPA-H高达4150万美元的资金支持。该倡议旨在通过将先进机器人与Meta的开源AI视觉模型相结合,为轮椅用户创造更安全、更具适应性的辅助移动解决方案。
NVIDIA推出了Cosmos-H-Dreams,这是一款面向手术机器人的实时、动作条件生成式模拟器,它将Cosmos-H-Surgical-Simulator的能力蒸馏到一个因果学生模型中。该系统通过NVIDIA的FlashDreams加速流式推理库提供服务,支持在闭环中由人员或学习到的策略进行交互控制。
Black Forest Labs 推出了 FLUX 3,这是一个包含原生音频视频生成能力的多模态流模型家族。此次发布还引入了 FLUX-mimic,一个专为视频动作机器人应用设计的变体。
本文概述了Physical AI仿真的当前状态,解释了仿真如何通过提供可扩展的、照片级真实的训练环境来弥合机器人领域的数据鸿沟。文章勾勒了一种三机范式(训练、仿真、机器人端),并根据特定能力和用例对关键仿真引擎进行了分类。
NVIDIA发布了Cosmos 3 Edge,这是一款拥有40亿参数的开放世界模型,旨在在设备上运行以支持机器人和视觉AI智能体。该模型于7月20日在Hugging Face上发布,使系统能够在不依赖云端的本地环境中理解周围环境、实时推理并生成机器人动作。
Pollen Robotics 发布了 Grabette,这是一款开源手持设备,旨在无需机器人或遥操作支架的情况下记录现实世界的机器人操作数据。该系统使用鱼眼相机和 RGBD 深度相机来捕获 6-DoF 轨迹,允许用户生成干净的数据集,这些数据集可以通过基于浏览器的仪表板进行处理,并在 Hugging Face Hub 上共享。
英伟达发布了Cosmos 3 Edge,这是一款拥有40亿参数的开放世界模型,旨在在内存受限的边缘系统上提供数据中心级别的性能。该模型使机器人和视觉AI智能体能够在NVIDIA Jetson模块等设备上直接理解周围环境、实时推理并生成动作。
Mistral AI 发布了 Robostral Navigate,这是其首款专为仅使用单个 RGB 相机进行具身导航而设计的模型。该 8B 参数模型接受自然语言指令和图像输入,以引导机器人在办公室和户外等复杂环境中移动。
研究人员推出了RoboTTT,这是一种训练方案,可将机器人基础模型的视觉运动上下文扩展至8,000个时间步,同时不增加推理延迟。该方法通过将测试时训练(Test-Time Training)整合到视觉-语言-动作(Vision-Language-Action)策略中,利用在训练和推理期间通过梯度下降更新的高速权重来实现。
NVIDIA推出RoboTTT,这是一种机器人基础模型及训练配方,可在不增加推理延迟的情况下将视觉运动上下文扩展至8,000个时间步。通过将测试时训练(Test-Time Training)集成到视觉-语言-动作(Vision-Language-Action)策略中,该系统利用由梯度下降更新的快速权重,将历史压缩至权重空间。
小米推出了Xiaomi-Robotics-U0,这是一款专为统一具身合成设计的380亿参数多模态自回归模型。该模型将具身生成视为基础图像和视频生成的扩展,联合优化文本到图像生成、图像编辑、具身场景生成、具身迁移和具身视频生成。
本文介绍了 PAC-ACT,一种旨在增强预训练 Action Chunking Transformer (ACT) 策略以用于工业精密接触任务的强化学习后训练框架。该方法在 chunk 级别重新表述了策略优化,并利用带有混合行为先验约束的 ACT 迁移 actor-critic 架构。
NVIDIA解决了严格评估机器人基础模型的问题,这些模型现在可以遵循自然语言指令来操作物体。该公司将评估确定为关键且未解决的难题,并提出了一种新方法来解决这些问题。