Google DeepMind telah merilis Gemini Robotics 2, lapisan kecerdasan yang terdiri dari tiga model yang dirancang untuk memungkinkan kontrol seluruh tubuh, ketangkasan lima jari, dan kolaborasi multi-robot. Rilis ini mencakup model Vision-Language-Action (VLA), VLM penalaran berbadan, dan VLA perangkat tepi, melampaui kemampuan manipulasi meja sebelumnya.
- Gemini Robotics 2 VLA mengendalikan humanoid penuh seperti Apptronik Apollo 2 dengan tangan SharpaWave, mencapai tingkat keberhasilan berkisar dari 32% hingga 92% di berbagai tugas ketangkasan.
- Gemini Robotics ER 2, berbasis pada Gemini 3.5 Flash, menangani perencanaan tingkat tinggi dan orkestrasi alat dengan jendela konteks 128k dan streaming dua arah melalui Gemini Live API.
- Gemini Robotics On-Device 2 memungkinkan eksekusi lokal dan adaptasi cepat ke badan robot baru, seperti platform SO101, di mana lonjakan kinerja dari 6.7% menjadi 53.3% keberhasilan.
- Suite ini mendukung kolaborasi multi-robot, yang dibuktikan dengan menggabungkan Apollo 2 dengan Franka F3 Duo untuk penyerahan tugas semantik bersama.
Model-model ini bertujuan mengatasi keterbatasan robot terprogram sebelumnya dengan memungkinkan adaptasi ke lingkungan yang tidak terduga dan transfer keterampilan di berbagai badan robot.