공유 GPU 풀 서빙을 통해 ROSA가 공장 생산성을 최대 12.06배 향상
연구자들은 로봇 공장을 위해 설계된 ROSA라는 로봇 파운데이션 모델 서빙 시스템을 제안하며, 이는 단일 로봇 및 엣지 컴퓨팅 가정에서 벗어나는 것을 목표로 합니다. 이 시스템은 네트워크를 통해 로봇 군집이 서버급 GPU에 접근할 수 있도록 공유 GPU 풀 서빙을 활용합니다.
연구자들은 로봇 공장을 위해 설계된 ROSA라는 로봇 파운데이션 모델 서빙 시스템을 제안하며, 이는 단일 로봇 및 엣지 컴퓨팅 가정에서 벗어나는 것을 목표로 합니다. 이 시스템은 네트워크를 통해 로봇 군집이 서버급 GPU에 접근할 수 있도록 공유 GPU 풀 서빙을 활용합니다.
Calibra v0.7.1은 품질 및 커버리지 분석 전에 실행되어 사용자가 로봇 데이터셋의 신뢰성을 확인할 수 있도록 도와주는 새로운 데이터셋 무결성(Dataset Integrity) 단계를 도입합니다.
Google DeepMind은 전신 제어, 다섯 손가락의 정교한 동작, 다중 로봇 협업을 가능하게 하기 위해 설계된 세 가지 모델로 구성된 인텔리전스 레이어인 Gemini Robotics 2를 출시했습니다. 이번 출시에는 비전-언어-액션(VLA) 모델, 구체적 추론 VLM, 그리고 온디바이스 VLA가 포함되어 이전의 테이블탑 조작 능력을 넘어섰습니다.
Google은 적응형 로봇에 지능적인 전신 제어, 고급 정교함 및 팀 협업 능력을 제공하도록 설계된 인텔리전스 레이어인 Gemini Robotics 2를 출시했습니다. 이 업데이트는 물리적 AI의 능력을 좁고 반복적인 작업을 넘어 확장하여 로봇이 움직임을 추론하고 새로운 신체에 빠르게 적응할 수 있도록 합니다.
구글은 로봇이 실시간으로 빠르게 사고하고 다단계 작업을 계획할 수 있도록 설계된 새로운 구체적 추론 모델인 제미니 로보틱스 ER 2를 출시했습니다. 이번 업데이트는 이전 ER 1.6 버전 대비 상당한 개선을 가져왔으며, 여기에는 연속 영상 기반 진행 상황 추적, 정밀한 순간 발견 및 네이티브 다중 로봇 협업 기능이 포함됩니다.
Calibra는 훈련 전에 로봇 데이터셋을 감사하고 품질 문제를 식별하도록 설계된 오픈소스 도구 모음입니다. 품질 인식 코어셋 구축 및 훈련 결과 추정을 위한 도구를 제공합니다.
Calibra는 연구자가 정책을 훈련하기 전에 로봇 데이터셋을 감사하고 품질 문제를 식별할 수 있도록 설계된 오픈소스 툴킷입니다. 첫 번째 공개 릴리스에는 LeRobot 데이터셋을 감사하기 위한 상호작용형 Space인 Robot Dataset Health Check와 건강 점수가 포함된 30개의 공개 LeRobot 데이터셋 벤치마크가 포함되어 있습니다.
피츠버그 대학교의 인간공학 연구소(Human Engineering Research Laboratories, HERL)는 장애인의 독립성을 위한 로봇 보조 이동 및 조작 플랫폼(RAMMP)을 주도하고 있으며, 이 프로젝트는 ARPA-H로부터 최대 41.5백만 달러의 자금 지원을 받고 있습니다. 이 계획은 고급 로봇공학과 Meta의 오픈소스 AI 비전 모델을 통합하여 휠체어 사용자를 위해 더 안전하고 적응력 있는 보조 이동 솔루션을 만드는 것을 목표로 합니다.
NVIDIA는 Cosmos-H-Surgical-Simulator의 기능을 인과적 학생 모델로 압축한 외과 로봇용 실시간 액션 조건부 생성 시뮬레이터인 Cosmos-H-Dreams를 출시했습니다. NVIDIA의 FlashDreams 가속 스트리밍 추론 라이브러리를 통해 제공되는 이 시스템은 폐쇄 루프 내에서 사람이나 학습된 정책이 상호작용할 수 있는 제어를 가능하게 합니다.
Black Forest Labs는 네이티브 오디오 비디오 생성 기능을 갖춘 멀티모달 플로우 모델 패밀리인 FLUX 3을 출시했습니다. 이번 릴리스에는 비디오 액션 로봇 애플리케이션용으로 설계된 변형인 FLUX-mimic도 포함되어 있습니다.
본 기사는 물리 AI의 시뮬레이션 현황을 개관하며, 확장 가능하고 사진 같은 고품질의 학습 환경을 제공함으로써 로봇 공학에서 데이터 격차를 해소하는 시뮬레이션의 역할을 설명합니다. 훈련, 시뮬레이션, 로봇 탑재라는 3대 컴퓨터 패러다임을 제시하고, 특정 기능과 사용 사례에 따라 주요 시뮬레이션 엔진을 분류합니다.
NVIDIA는 로봇과 비전 AI 에이전트를 위해 온디바이스에서 실행하도록 설계된 40억 파라미터 규모의 오픈 월드 모델인 Cosmos 3 Edge를 출시했습니다. Hugging Face에서 7월 20일 공개된 이 모델은 클라우드 의존성 없이 로컬에서 주변 환경을 이해하고 실시간으로 추론하며 로봇 행동을 생성할 수 있게 합니다.
Pollen Robotics는 로봇이나 원격 조종 장치가 필요 없이 실제 세계의 로봇 조작 데이터를 기록하도록 설계된 오픈소스 휴대용 장치인 Grabette를 출시했습니다. 이 시스템은 어안 카메라와 RGBD 깊이 카메라를 사용하여 6-DoF 궤적을 캡처하며, 이를 통해 브라우저 기반 대시보드를 통해 처리하고 Hugging Face Hub에 공유할 수 있는 정제된 데이터셋을 생성할 수 있습니다.
NVIDIA는 메모리가 제한된 엣지 시스템에서 데이터 센터 수준의 성능을 제공하도록 설계된 40억 파라미터의 오픈 월드 모델인 Cosmos 3 Edge를 출시했습니다. 이 모델은 로봇과 비전 AI 에이전트가 주변 환경을 이해하고, 실시간으로 추론하며, NVIDIA Jetson 모듈과 같은 디바이스에서 직접 행동을 생성할 수 있게 합니다.
Mistral AI는 단일 RGB 카메라만으로 구현형 내비게이션을 위해 설계된 첫 번째 모델인 Robostral Navigate를 출시했습니다. 이 8B 파라미터 모델은 일반 언어 지시와 이미지 입력을 받아 사무실 및 야외 환경과 같은 복잡한 공간을 로봇이 이동하도록 안내합니다.
연구자들은 시각운동 컨텍스트를 추론 지연 시간 증가 없이 8,000 타임스텝까지 확장하는 로봇 파운데이션 모델을 위한 학습 레시피인 RoboTTT를 소개합니다. 이 방법은 훈련 및 추론 모두에서 경사 하강법을 통해 업데이트되는 빠른 가중치를 사용하여 Vision-Language-Action 정책에 테스트 타임 트레이닝을 통합합니다.
NVIDIA는 추론 지연 시간을 증가시키지 않고 시각운동 컨텍스트를 8,000 타임스텝으로 확장하는 로봇 파운데이션 모델 및 학습 레시피인 RoboTTT를 소개합니다. 테스트 타임 트레이닝을 비전-라이트액션 정책에 통합함으로써, 이 시스템은 경사 하강법으로 업데이트되는 빠른 가중치를 사용하여 히스토리를 가중치 공간으로 압축합니다.
샤오미는 통합 구현 합성을 위해 설계된 380억 파라미터의 멀티모달 자기회귀 모델인 Xiaomi-Robotics-U0를 선보였습니다. 이 모델은 구현 생성을 기본 이미지 및 비디오 생성의 확장으로 간주하며, 텍스트-이미지 생성, 이미지 편집, 구현 장면 생성, 구현 변환, 구현 비디오 생성을 함께 최적화합니다.
본 논문은 산업용 정밀 접촉 작업을 위해 사전 학습된 Action Chunking Transformer (ACT) 정책을 강화하도록 설계된 강화학습 사후 학습 프레임워크인 PAC-ACT를 소개합니다. 이 방법은 청크 수준에서 정책 최적화를 재정의하고 하이브리드 행동 사전 제약이 있는 ACT 이전 액터-크리틱 아키텍처를 활용합니다.
NVIDIA는 자연어 지시를 따라 물체를 조작할 수 있는 로봇 파운데이션 모델의 엄격한 평가라는 과제를 다루고 있습니다. 동사는 평가를 해결해야 할 중요한 미해결 문제로 식별하고 이러한 문제를 해결하기 위한 새로운 방법을 제시했습니다.