Robotics
media MarkTechPost · 9일 전 · 조회수 2회

Google DeepMind, 전신 제어 및 정교함 향상을 위한 Gemini Robotics 2 출시

Google DeepMind은 전신 제어, 다섯 손가락의 정교한 동작, 다중 로봇 협업을 가능하게 하기 위해 설계된 세 가지 모델로 구성된 인텔리전스 레이어인 Gemini Robotics 2를 출시했습니다. 이번 출시에는 비전-언어-액션(VLA) 모델, 구체적 추론 VLM, 그리고 온디바이스 VLA가 포함되어 이전의 테이블탑 조작 능력을 넘어섰습니다.

lab Google DeepMind Blog · 10일 전 · 조회수 4회

Google, 전신 제어 및 다중 로봇 협업을 위한 Gemini Robotics 2 출시

Google은 적응형 로봇에 지능적인 전신 제어, 고급 정교함 및 팀 협업 능력을 제공하도록 설계된 인텔리전스 레이어인 Gemini Robotics 2를 출시했습니다. 이 업데이트는 물리적 AI의 능력을 좁고 반복적인 작업을 넘어 확장하여 로봇이 움직임을 추론하고 새로운 신체에 빠르게 적응할 수 있도록 합니다.

lab Google DeepMind Blog · 10일 전 · 조회수 9회

구글, 영상 이해 및 다중 로봇 협력을 갖춘 제미니 로보틱스 ER 2 출시

구글은 로봇이 실시간으로 빠르게 사고하고 다단계 작업을 계획할 수 있도록 설계된 새로운 구체적 추론 모델인 제미니 로보틱스 ER 2를 출시했습니다. 이번 업데이트는 이전 ER 1.6 버전 대비 상당한 개선을 가져왔으며, 여기에는 연속 영상 기반 진행 상황 추적, 정밀한 순간 발견 및 네이티브 다중 로봇 협업 기능이 포함됩니다.

media Hugging Face Forums · 12일 전 · 조회수 2회

Calibra: 로봇 데이터셋 관측성을 위한 오픈소스 툴킷

Calibra는 연구자가 정책을 훈련하기 전에 로봇 데이터셋을 감사하고 품질 문제를 식별할 수 있도록 설계된 오픈소스 툴킷입니다. 첫 번째 공개 릴리스에는 LeRobot 데이터셋을 감사하기 위한 상호작용형 Space인 Robot Dataset Health Check와 건강 점수가 포함된 30개의 공개 LeRobot 데이터셋 벤치마크가 포함되어 있습니다.

lab Meta AI / FAIR Blog · 13일 전 · 조회수 3회

피츠버그 대학교, ARPA-H 자금 지원 RAMMP 보조 로봇에 Meta의 DINOv3 및 SAM 활용

피츠버그 대학교의 인간공학 연구소(Human Engineering Research Laboratories, HERL)는 장애인의 독립성을 위한 로봇 보조 이동 및 조작 플랫폼(RAMMP)을 주도하고 있으며, 이 프로젝트는 ARPA-H로부터 최대 41.5백만 달러의 자금 지원을 받고 있습니다. 이 계획은 고급 로봇공학과 Meta의 오픈소스 AI 비전 모델을 통합하여 휠체어 사용자를 위해 더 안전하고 적응력 있는 보조 이동 솔루션을 만드는 것을 목표로 합니다.

lab Hugging Face Blog · 13일 전 · 조회수 19회

NVIDIA, 외과 로봇용 실시간 생성 시뮬레이터 Cosmos-H-Dreams 출시

NVIDIA는 Cosmos-H-Surgical-Simulator의 기능을 인과적 학생 모델로 압축한 외과 로봇용 실시간 액션 조건부 생성 시뮬레이터인 Cosmos-H-Dreams를 출시했습니다. NVIDIA의 FlashDreams 가속 스트리밍 추론 라이브러리를 통해 제공되는 이 시스템은 폐쇄 루프 내에서 사람이나 학습된 정책이 상호작용할 수 있는 제어를 가능하게 합니다.

lab Hugging Face Blog · 19일 전 · 조회수 8회

물리 AI용 시뮬레이션 엔진 개요: MuJoCo, Isaac Sim 및 Newton

본 기사는 물리 AI의 시뮬레이션 현황을 개관하며, 확장 가능하고 사진 같은 고품질의 학습 환경을 제공함으로써 로봇 공학에서 데이터 격차를 해소하는 시뮬레이션의 역할을 설명합니다. 훈련, 시뮬레이션, 로봇 탑재라는 3대 컴퓨터 패러다임을 제시하고, 특정 기능과 사용 사례에 따라 주요 시뮬레이션 엔진을 분류합니다.

media MarkTechPost · 19일 전 · 조회수 4회

NVIDIA가 온디바이스 로봇 추론을 위한 4B 오픈 월드 모델인 Cosmos 3 Edge 출시

NVIDIA는 로봇과 비전 AI 에이전트를 위해 온디바이스에서 실행하도록 설계된 40억 파라미터 규모의 오픈 월드 모델인 Cosmos 3 Edge를 출시했습니다. Hugging Face에서 7월 20일 공개된 이 모델은 클라우드 의존성 없이 로컬에서 주변 환경을 이해하고 실시간으로 추론하며 로봇 행동을 생성할 수 있게 합니다.

lab Hugging Face Blog · 19일 전 · 조회수 2회

Pollen Robotics가 로봇 조작 데이터 기록을 위한 오픈 저비용 시스템 Grabette를 출시

Pollen Robotics는 로봇이나 원격 조종 장치가 필요 없이 실제 세계의 로봇 조작 데이터를 기록하도록 설계된 오픈소스 휴대용 장치인 Grabette를 출시했습니다. 이 시스템은 어안 카메라와 RGBD 깊이 카메라를 사용하여 6-DoF 궤적을 캡처하며, 이를 통해 브라우저 기반 대시보드를 통해 처리하고 Hugging Face Hub에 공유할 수 있는 정제된 데이터셋을 생성할 수 있습니다.

lab Hugging Face Blog · 20일 전 · 조회수 1회

NVIDIA가 엣지 디바이스에서의 실시간 로봇 제어를 위한 4B 파라미터 모델인 Cosmos 3 Edge를 출시

NVIDIA는 메모리가 제한된 엣지 시스템에서 데이터 센터 수준의 성능을 제공하도록 설계된 40억 파라미터의 오픈 월드 모델인 Cosmos 3 Edge를 출시했습니다. 이 모델은 로봇과 비전 AI 에이전트가 주변 환경을 이해하고, 실시간으로 추론하며, NVIDIA Jetson 모듈과 같은 디바이스에서 직접 행동을 생성할 수 있게 합니다.

arxiv arXiv cs.LG · 23일 전 · 조회수 2회

RoboTTT는 로봇 정책의 컨텍스트를 8K 타임스텝으로 확장합니다

연구자들은 시각운동 컨텍스트를 추론 지연 시간 증가 없이 8,000 타임스텝까지 확장하는 로봇 파운데이션 모델을 위한 학습 레시피인 RoboTTT를 소개합니다. 이 방법은 훈련 및 추론 모두에서 경사 하강법을 통해 업데이트되는 빠른 가중치를 사용하여 Vision-Language-Action 정책에 테스트 타임 트레이닝을 통합합니다.

arxiv arXiv cs.AI · 23일 전

RoboTTT는 로봇 정책을 8K 타임스텝 컨텍스트로 확장합니다

NVIDIA는 추론 지연 시간을 증가시키지 않고 시각운동 컨텍스트를 8,000 타임스텝으로 확장하는 로봇 파운데이션 모델 및 학습 레시피인 RoboTTT를 소개합니다. 테스트 타임 트레이닝을 비전-라이트액션 정책에 통합함으로써, 이 시스템은 경사 하강법으로 업데이트되는 빠른 가중치를 사용하여 히스토리를 가중치 공간으로 압축합니다.

arxiv arXiv cs.AI · 23일 전 SWE-bench Pro · 63.2%

샤오미, 통합 구현 합성을 위한 38B 파라미터 모델 U0 출시

샤오미는 통합 구현 합성을 위해 설계된 380억 파라미터의 멀티모달 자기회귀 모델인 Xiaomi-Robotics-U0를 선보였습니다. 이 모델은 구현 생성을 기본 이미지 및 비디오 생성의 확장으로 간주하며, 텍스트-이미지 생성, 이미지 편집, 구현 장면 생성, 구현 변환, 구현 비디오 생성을 함께 최적화합니다.

arxiv arXiv cs.AI · 27일 전 · 조회수 1회

PAC-ACT 사후 학습 프레임워크가 정밀 접촉 조작을 위한 ACT 정책을 개선

본 논문은 산업용 정밀 접촉 작업을 위해 사전 학습된 Action Chunking Transformer (ACT) 정책을 강화하도록 설계된 강화학습 사후 학습 프레임워크인 PAC-ACT를 소개합니다. 이 방법은 청크 수준에서 정책 최적화를 재정의하고 하이브리드 행동 사전 제약이 있는 ACT 이전 액터-크리틱 아키텍처를 활용합니다.