주제 · Robotics
lab Google DeepMind Blog · 15일 전 · 조회수 8회

Google, 전신 제어 및 다중 로봇 협업을 위한 Gemini Robotics 2 출시

Google은 적응형 로봇에 지능적인 전신 제어, 고급 정교함 및 팀 협업 능력을 제공하도록 설계된 인텔리전스 레이어인 Gemini Robotics 2를 출시했습니다. 이 업데이트는 물리적 AI의 능력을 좁고 반복적인 작업을 넘어 확장하여 로봇이 움직임을 추론하고 새로운 신체에 빠르게 적응할 수 있도록 합니다.

lab Google DeepMind Blog · 15일 전 · 조회수 13회

구글, 영상 이해 및 다중 로봇 협력을 갖춘 제미니 로보틱스 ER 2 출시

구글은 로봇이 실시간으로 빠르게 사고하고 다단계 작업을 계획할 수 있도록 설계된 새로운 구체적 추론 모델인 제미니 로보틱스 ER 2를 출시했습니다. 이번 업데이트는 이전 ER 1.6 버전 대비 상당한 개선을 가져왔으며, 여기에는 연속 영상 기반 진행 상황 추적, 정밀한 순간 발견 및 네이티브 다중 로봇 협업 기능이 포함됩니다.

lab Meta AI / FAIR Blog · 18일 전 · 조회수 7회

피츠버그 대학교, ARPA-H 자금 지원 RAMMP 보조 로봇에 Meta의 DINOv3 및 SAM 활용

피츠버그 대학교의 인간공학 연구소(Human Engineering Research Laboratories, HERL)는 장애인의 독립성을 위한 로봇 보조 이동 및 조작 플랫폼(RAMMP)을 주도하고 있으며, 이 프로젝트는 ARPA-H로부터 최대 41.5백만 달러의 자금 지원을 받고 있습니다. 이 계획은 고급 로봇공학과 Meta의 오픈소스 AI 비전 모델을 통합하여 휠체어 사용자를 위해 더 안전하고 적응력 있는 보조 이동 솔루션을 만드는 것을 목표로 합니다.

media MarkTechPost · 15일 전 · 조회수 4회

Google DeepMind, 전신 제어 및 정교함 향상을 위한 Gemini Robotics 2 출시

Google DeepMind은 전신 제어, 다섯 손가락의 정교한 동작, 다중 로봇 협업을 가능하게 하기 위해 설계된 세 가지 모델로 구성된 인텔리전스 레이어인 Gemini Robotics 2를 출시했습니다. 이번 출시에는 비전-언어-액션(VLA) 모델, 구체적 추론 VLM, 그리고 온디바이스 VLA가 포함되어 이전의 테이블탑 조작 능력을 넘어섰습니다.

lab Hugging Face Blog · 25일 전 · 조회수 1회

NVIDIA가 엣지 디바이스에서의 실시간 로봇 제어를 위한 4B 파라미터 모델인 Cosmos 3 Edge를 출시

NVIDIA는 메모리가 제한된 엣지 시스템에서 데이터 센터 수준의 성능을 제공하도록 설계된 40억 파라미터의 오픈 월드 모델인 Cosmos 3 Edge를 출시했습니다. 이 모델은 로봇과 비전 AI 에이전트가 주변 환경을 이해하고, 실시간으로 추론하며, NVIDIA Jetson 모듈과 같은 디바이스에서 직접 행동을 생성할 수 있게 합니다.

lab Hugging Face Blog · 1일 전 · 조회수 3회

Strands Agents가 LeRobot 및 Hugging Face Storage Buckets를 통합하여 로봇 데이터의 지속적 루프 구현

AWS는 LeRobot 데이터셋과 Hugging Face Storage Buckets를 사용하여 로봇 정책의 기록, 학습 및 배포의 지속적 루프를 가능하게 하는 Strands Agents를 도입했습니다. 이 통합을 통해 에이전트는 변경 가능한 버킷에 데모를 동기화하고 바이트 수준 중복 제거를 수행하며 전체 다운로드 없이 Hub에서 직접 데이터셋을 스트리밍하여 학습할 수 있습니다.

media MarkTechPost · 1일 전 · 조회수 6회

Dyna Robotics가 100만 시간의 인간 영상을 기반으로 사전 학습된 월드 액션 모델 Dyna-2 출시

Dyna Robotics는 시점 인간 영상 100만 시간 이상으로 사전 학습된 로봇 조작용 월드 액션 모델인 Dyna-2를 출시했습니다. 동사는 1,000시간에서 1,000,000시간까지의 스케일링 법칙을 확립함으로써 일반 인간 영상이 액션 레이블 데이터의 대체재가 될 수 있음을 입증했습니다.

media Hugging Face Forums · 17일 전 · 조회수 3회

Calibra: 로봇 데이터셋 관측성을 위한 오픈소스 툴킷

Calibra는 연구자가 정책을 훈련하기 전에 로봇 데이터셋을 감사하고 품질 문제를 식별할 수 있도록 설계된 오픈소스 툴킷입니다. 첫 번째 공개 릴리스에는 LeRobot 데이터셋을 감사하기 위한 상호작용형 Space인 Robot Dataset Health Check와 건강 점수가 포함된 30개의 공개 LeRobot 데이터셋 벤치마크가 포함되어 있습니다.

lab Hugging Face Blog · 19일 전 · 조회수 23회

NVIDIA, 외과 로봇용 실시간 생성 시뮬레이터 Cosmos-H-Dreams 출시

NVIDIA는 Cosmos-H-Surgical-Simulator의 기능을 인과적 학생 모델로 압축한 외과 로봇용 실시간 액션 조건부 생성 시뮬레이터인 Cosmos-H-Dreams를 출시했습니다. NVIDIA의 FlashDreams 가속 스트리밍 추론 라이브러리를 통해 제공되는 이 시스템은 폐쇄 루프 내에서 사람이나 학습된 정책이 상호작용할 수 있는 제어를 가능하게 합니다.

lab Hugging Face Blog · 24일 전 · 조회수 8회

물리 AI용 시뮬레이션 엔진 개요: MuJoCo, Isaac Sim 및 Newton

본 기사는 물리 AI의 시뮬레이션 현황을 개관하며, 확장 가능하고 사진 같은 고품질의 학습 환경을 제공함으로써 로봇 공학에서 데이터 격차를 해소하는 시뮬레이션의 역할을 설명합니다. 훈련, 시뮬레이션, 로봇 탑재라는 3대 컴퓨터 패러다임을 제시하고, 특정 기능과 사용 사례에 따라 주요 시뮬레이션 엔진을 분류합니다.

media MarkTechPost · 24일 전 · 조회수 6회

NVIDIA가 온디바이스 로봇 추론을 위한 4B 오픈 월드 모델인 Cosmos 3 Edge 출시

NVIDIA는 로봇과 비전 AI 에이전트를 위해 온디바이스에서 실행하도록 설계된 40억 파라미터 규모의 오픈 월드 모델인 Cosmos 3 Edge를 출시했습니다. Hugging Face에서 7월 20일 공개된 이 모델은 클라우드 의존성 없이 로컬에서 주변 환경을 이해하고 실시간으로 추론하며 로봇 행동을 생성할 수 있게 합니다.

lab Hugging Face Blog · 25일 전 · 조회수 2회

Pollen Robotics가 로봇 조작 데이터 기록을 위한 오픈 저비용 시스템 Grabette를 출시

Pollen Robotics는 로봇이나 원격 조종 장치가 필요 없이 실제 세계의 로봇 조작 데이터를 기록하도록 설계된 오픈소스 휴대용 장치인 Grabette를 출시했습니다. 이 시스템은 어안 카메라와 RGBD 깊이 카메라를 사용하여 6-DoF 궤적을 캡처하며, 이를 통해 브라우저 기반 대시보드를 통해 처리하고 Hugging Face Hub에 공유할 수 있는 정제된 데이터셋을 생성할 수 있습니다.

arxiv arXiv cs.LG · 28일 전 · 조회수 2회

RoboTTT는 로봇 정책의 컨텍스트를 8K 타임스텝으로 확장합니다

연구자들은 시각운동 컨텍스트를 추론 지연 시간 증가 없이 8,000 타임스텝까지 확장하는 로봇 파운데이션 모델을 위한 학습 레시피인 RoboTTT를 소개합니다. 이 방법은 훈련 및 추론 모두에서 경사 하강법을 통해 업데이트되는 빠른 가중치를 사용하여 Vision-Language-Action 정책에 테스트 타임 트레이닝을 통합합니다.

arxiv arXiv cs.AI · 28일 전

RoboTTT는 로봇 정책을 8K 타임스텝 컨텍스트로 확장합니다

NVIDIA는 추론 지연 시간을 증가시키지 않고 시각운동 컨텍스트를 8,000 타임스텝으로 확장하는 로봇 파운데이션 모델 및 학습 레시피인 RoboTTT를 소개합니다. 테스트 타임 트레이닝을 비전-라이트액션 정책에 통합함으로써, 이 시스템은 경사 하강법으로 업데이트되는 빠른 가중치를 사용하여 히스토리를 가중치 공간으로 압축합니다.