Google、全身制御と複数ロボット協調のためのGemini Robotics 2を発表
Googleは、適応型ロボットにインテリジェントな全身制御、高度な器用さ、チームでの協力能力を提供するように設計されたインテリジェンスレイヤーであるGemini Robotics 2を導入しました。このアップデートは、物理的なAIの能力を狭く反復的なタスクを超えて拡張し、ロボットが動きについて推論し、新しい身体に迅速に適応できるようにします。
Googleは、適応型ロボットにインテリジェントな全身制御、高度な器用さ、チームでの協力能力を提供するように設計されたインテリジェンスレイヤーであるGemini Robotics 2を導入しました。このアップデートは、物理的なAIの能力を狭く反復的なタスクを超えて拡張し、ロボットが動きについて推論し、新しい身体に迅速に適応できるようにします。
Googleは、ロボットが高速に思考しリアルタイムで多段階のタスクを計画できるように設計された新しい具現化推論モデルであるGemini Robotics ER 2を発売しました。今回のアップデートでは、以前のER 1.6バージョンと比較して大幅な改善がもたらされ、動画ベースの継続的な進捗追跡、精密な瞬間特定、ネイティブなマルチロボット協調機能が含まれています。
研究者らは、ロボット工場で使用されることを目的としたロボティクス基盤モデルのサービングシステム「ROSA」を提案した。これは単一ロボットやエッジコンピューティングの前提を超えたものである。本システムは共有GPUプールサービングを活用し、ロボット群がネットワーク経由でサーバークラスのGPUにアクセスできるようにする。
ピッツバーグ大学の人間工学研究ラボ(HERL)は、障害者の自立を支援するロボティクス支援移動・操作プラットフォーム(RAMMP)を主導しており、このプロジェクトにはARPA-Hから最大4,150万米ドルの資金提供がなされています。この取り組みは、高度なロボティクスとMetaのオープンソースAIビジョンモデルを統合することで、車椅子利用者のためのより安全で適応性の高い支援移動ソリューションの創出を目指しています。
Google DeepMindは、全身制御、5本指の器用さ、マルチロボット協力を可能にするために設計された3つのモデルで構成されるインテリジェンスレイヤーであるGemini Robotics 2をリリースした。今回のリリースには、ビジョン・言語・アクション(VLA)モデル、具現化推論用のVLM、およびデバイス上VLAが含まれており、以前の卓上操作の能力を超えている。
NVIDIAは、メモリ制約のあるエッジシステムでデータセンターレベルのパフォーマンスを提供するために設計された40億パラメータのオープンワールドモデルであるCosmos 3 Edgeをリリースしました。このモデルにより、ロボットやビジョンAIエージェントは周囲の環境を理解し、リアルタイムで推論を行い、NVIDIA Jetsonモジュールなどのデバイス上で直接アクションを生成することが可能になります。
AWSは、LeRobotデータセットとHugging Face Storage Bucketsを使用して、ロボットポリシーの記録、トレーニング、展開の継続的なループを可能にするStrands Agentsを導入しました。この統合により、エージェントは変更可能なバケットにデモンストレーションを同期し、バイトレベルの重複排除を行いながら、フルダウンロードなしでHubから直接データセットをストリーミングしてトレーニングできます。
Dyna Roboticsは、100万時間以上の自己中心型人間の動画で事前学習されたロボット操作用の世界行動モデル「Dyna-2」をリリースした。同社は、1,000時間から1,000,000時間へのスケーリング法則を確立することで、通常の人間の動画がアクションラベル付きデータの代用になり得ることを実証している。
著者は、ロボティクス学習データセットの分析と整合性の確保を目的としたオープンソースツールキットであるCalibraを紹介します。このツールは、トレーニング開始前に問題のあるデータを特定することで、計算資源の無駄を防ぐことを目指しています。
Calibra v0.7.1 は、品質およびカバレッジ分析の前に実行される新しいデータセット整合性(Dataset Integrity)ステージを導入し、ユーザーがロボティクスデータセットの信頼性を確認できるよう支援します。
Calibra は、トレーニング前にロボットデータセットを監査し、品質の問題を特定するために設計されたオープンソースのツールキットです。品質を考慮したコアセットの構築とトレーニング結果の見積もりに役立つツールを提供します。
Calibraは、研究者がポリシーをトレーニングする前にロボットデータセットを検証し、品質の問題を特定するのに役立つように設計されたオープンソースのツールキットです。最初の公開リリースには、LeRobotデータセットを検証するためのインタラクティブなSpace「Robot Dataset Health Check」と、ヘルススコア付きの30の公開LeRobotデータセットのベンチマークが含まれています。
NVIDIAは、Cosmos-H-Surgical-Simulatorの能力を因果的な学生モデルに凝縮した、手術用ロボティクス向けのリアルタイムかつ行動条件付きの生成シミュレーターであるCosmos-H-Dreamsを発表しました。NVIDIAのFlashDreams加速ストリーミング推論ライブラリを通じて提供され、このシステムは閉ループ内での人間または学習されたポリシーによるインタラクティブな制御を可能にします。
Black Forest Labsは、ネイティブオーディオのビデオ生成機能を含むマルチモーダルフローモデルファミリーであるFLUX 3をリリースしました。今回のリリースでは、ビデオアクションロボットアプリケーション用に設計されたバリアントであるFLUX-mimicも導入されています。
本記事では、スケーラブルでフォトリアリスティックなトレーニング環境を可能にすることで、ロボティクスにおけるデータギャップを埋めるシミュレーションの役割を解説し、Physical AIのシミュレーションの現状を概観する。トレーニング、シミュレーション、ロボット搭載という3つのコンピュータによるパラダイムを示し、特定の機能とユースケースに基づいて主要なシミュレーションエンジンを分類している。
NVIDIAは、ロボットやビジョンAIエージェント向けにデバイス上で実行できるように設計された40億パラメータのオープンワールドモデル「Cosmos 3 Edge」をリリースした。7月20日にHugging Faceで公開され、クラウドへの依存なしで、システムが周囲を理解し、リアルタイムで推論を行い、ロボットアクションをローカルで生成することを可能にする。
Pollen Roboticsは、ロボットやテレオペレーション rigs を必要とせずに現実世界のロボット操作データを記録するために設計されたオープンソースのハンドヘルドデバイスであるGrabetteをリリースした。このシステムは魚眼カメラとRGBD深度カメラを使用して6自由度(DoF)の軌跡を捉え、ユーザーがブラウザベースのダッシュボードを通じて処理し、Hugging Face Hubで共有できるクリーンなデータセットを生成できるようにする。
研究者らは、視覚運動コンテキストをロボット基盤モデル向けに8,000タイムステップまで拡張しつつ推論レイテンシを増加させないトレーニングレシピであるRoboTTTを発表した。この手法は、トレーニングと推論の両方で勾配降下によって更新される高速重みを用いることで、テストタイムトレーニングをビジョン・ランゲージ・アクションポリシーに統合する。
NVIDIAは、推論レイテンシを増加させることなく視覚運動コンテキストを8,000タイムステップに拡張するロボットファウンデーションモデルおよびトレーニングレシピであるRoboTTTを発表した。テストタイムトレーニングをVision-Language-Actionポリシーに統合することで、システムは勾配降下によって更新される高速重みを用いて履歴を重み空間に圧縮する。