Google DeepMindは、全身制御、5本指の器用さ、マルチロボット協力を可能にするために設計された3つのモデルで構成されるインテリジェンスレイヤーであるGemini Robotics 2をリリースした。今回のリリースには、ビジョン・言語・アクション(VLA)モデル、具現化推論用のVLM、およびデバイス上VLAが含まれており、以前の卓上操作の能力を超えている。
- Gemini Robotics 2 VLAは、SharpaWaveハンドを搭載したApptronik Apollo 2のような完全なヒューマノイドを駆動し、器用さタスクにおいて32%から92%の成功率を達成している。
- Gemini 3.5 Flashに基づくGemini Robotics ER 2は、128kのコンテキストウィンドウとGemini Live API経由の双方向ストリーミングで、高レベルの計画とツールオーケストレーションを処理する。
- Gemini Robotics On-Device 2は、ローカル実行とSO101プラットフォームのような新しいロボットボディへの急速な適応を可能にし、成功率が6.7%から53.3%に向上した。
- このスイートはマルチロボット協力をサポートしており、Apollo 2とFranka F3 Duoのペアリングによる共有セマンティックタスクの引き継ぎで実証されている。
これらのモデルは、予測不可能な環境への適応や異なるロボットボディ間でのスキル転送を可能にすることで、事前にプログラムされたロボットの限界に対処することを目指している。