ROSAが共有GPUプールサービングにより工場生産性を最大12.06倍向上
研究者らは、ロボット工場で使用されることを目的としたロボティクス基盤モデルのサービングシステム「ROSA」を提案した。これは単一ロボットやエッジコンピューティングの前提を超えたものである。本システムは共有GPUプールサービングを活用し、ロボット群がネットワーク経由でサーバークラスのGPUにアクセスできるようにする。
研究者らは、ロボット工場で使用されることを目的としたロボティクス基盤モデルのサービングシステム「ROSA」を提案した。これは単一ロボットやエッジコンピューティングの前提を超えたものである。本システムは共有GPUプールサービングを活用し、ロボット群がネットワーク経由でサーバークラスのGPUにアクセスできるようにする。
Calibra v0.7.1 は、品質およびカバレッジ分析の前に実行される新しいデータセット整合性(Dataset Integrity)ステージを導入し、ユーザーがロボティクスデータセットの信頼性を確認できるよう支援します。
Google DeepMindは、全身制御、5本指の器用さ、マルチロボット協力を可能にするために設計された3つのモデルで構成されるインテリジェンスレイヤーであるGemini Robotics 2をリリースした。今回のリリースには、ビジョン・言語・アクション(VLA)モデル、具現化推論用のVLM、およびデバイス上VLAが含まれており、以前の卓上操作の能力を超えている。
Googleは、適応型ロボットにインテリジェントな全身制御、高度な器用さ、チームでの協力能力を提供するように設計されたインテリジェンスレイヤーであるGemini Robotics 2を導入しました。このアップデートは、物理的なAIの能力を狭く反復的なタスクを超えて拡張し、ロボットが動きについて推論し、新しい身体に迅速に適応できるようにします。
Googleは、ロボットが高速に思考しリアルタイムで多段階のタスクを計画できるように設計された新しい具現化推論モデルであるGemini Robotics ER 2を発売しました。今回のアップデートでは、以前のER 1.6バージョンと比較して大幅な改善がもたらされ、動画ベースの継続的な進捗追跡、精密な瞬間特定、ネイティブなマルチロボット協調機能が含まれています。
Calibra は、トレーニング前にロボットデータセットを監査し、品質の問題を特定するために設計されたオープンソースのツールキットです。品質を考慮したコアセットの構築とトレーニング結果の見積もりに役立つツールを提供します。
Calibraは、研究者がポリシーをトレーニングする前にロボットデータセットを検証し、品質の問題を特定するのに役立つように設計されたオープンソースのツールキットです。最初の公開リリースには、LeRobotデータセットを検証するためのインタラクティブなSpace「Robot Dataset Health Check」と、ヘルススコア付きの30の公開LeRobotデータセットのベンチマークが含まれています。
ピッツバーグ大学の人間工学研究ラボ(HERL)は、障害者の自立を支援するロボティクス支援移動・操作プラットフォーム(RAMMP)を主導しており、このプロジェクトにはARPA-Hから最大4,150万米ドルの資金提供がなされています。この取り組みは、高度なロボティクスとMetaのオープンソースAIビジョンモデルを統合することで、車椅子利用者のためのより安全で適応性の高い支援移動ソリューションの創出を目指しています。
NVIDIAは、Cosmos-H-Surgical-Simulatorの能力を因果的な学生モデルに凝縮した、手術用ロボティクス向けのリアルタイムかつ行動条件付きの生成シミュレーターであるCosmos-H-Dreamsを発表しました。NVIDIAのFlashDreams加速ストリーミング推論ライブラリを通じて提供され、このシステムは閉ループ内での人間または学習されたポリシーによるインタラクティブな制御を可能にします。
Black Forest Labsは、ネイティブオーディオのビデオ生成機能を含むマルチモーダルフローモデルファミリーであるFLUX 3をリリースしました。今回のリリースでは、ビデオアクションロボットアプリケーション用に設計されたバリアントであるFLUX-mimicも導入されています。
本記事では、スケーラブルでフォトリアリスティックなトレーニング環境を可能にすることで、ロボティクスにおけるデータギャップを埋めるシミュレーションの役割を解説し、Physical AIのシミュレーションの現状を概観する。トレーニング、シミュレーション、ロボット搭載という3つのコンピュータによるパラダイムを示し、特定の機能とユースケースに基づいて主要なシミュレーションエンジンを分類している。
NVIDIAは、ロボットやビジョンAIエージェント向けにデバイス上で実行できるように設計された40億パラメータのオープンワールドモデル「Cosmos 3 Edge」をリリースした。7月20日にHugging Faceで公開され、クラウドへの依存なしで、システムが周囲を理解し、リアルタイムで推論を行い、ロボットアクションをローカルで生成することを可能にする。
Pollen Roboticsは、ロボットやテレオペレーション rigs を必要とせずに現実世界のロボット操作データを記録するために設計されたオープンソースのハンドヘルドデバイスであるGrabetteをリリースした。このシステムは魚眼カメラとRGBD深度カメラを使用して6自由度(DoF)の軌跡を捉え、ユーザーがブラウザベースのダッシュボードを通じて処理し、Hugging Face Hubで共有できるクリーンなデータセットを生成できるようにする。
NVIDIAは、メモリ制約のあるエッジシステムでデータセンターレベルのパフォーマンスを提供するために設計された40億パラメータのオープンワールドモデルであるCosmos 3 Edgeをリリースしました。このモデルにより、ロボットやビジョンAIエージェントは周囲の環境を理解し、リアルタイムで推論を行い、NVIDIA Jetsonモジュールなどのデバイス上で直接アクションを生成することが可能になります。
Mistral AIは、単一のRGBカメラのみを使用した具現化ナビゲーション用に設計された初のモデルであるRobostral Navigateをリリースした。この8Bパラメータのモデルは、自然言語の指示と画像入力を接受し、オフィスや屋外の環境といった複雑な場面においてロボットを誘導する。
研究者らは、視覚運動コンテキストをロボット基盤モデル向けに8,000タイムステップまで拡張しつつ推論レイテンシを増加させないトレーニングレシピであるRoboTTTを発表した。この手法は、トレーニングと推論の両方で勾配降下によって更新される高速重みを用いることで、テストタイムトレーニングをビジョン・ランゲージ・アクションポリシーに統合する。
NVIDIAは、推論レイテンシを増加させることなく視覚運動コンテキストを8,000タイムステップに拡張するロボットファウンデーションモデルおよびトレーニングレシピであるRoboTTTを発表した。テストタイムトレーニングをVision-Language-Actionポリシーに統合することで、システムは勾配降下によって更新される高速重みを用いて履歴を重み空間に圧縮する。
Xiaomiは、統一具現化合成のために設計された380億パラメータのマルチモーダル自己回帰モデルであるXiaomi-Robotics-U0を発表した。このモデルは、具現化生成を基礎となる画像および動画生成の拡張と見なし、テキストから画像への生成、画像編集、具現化シーン生成、具現化転送、具現化動画生成を同時に最適化する。
本論文は、産業用精密接触タスクのために事前学習済みAction Chunking Transformer (ACT) ポリシーを強化するために設計された強化学習のポストトレーニングフレームワークであるPAC-ACTを紹介します。この手法はチャンクレベルでのポリシー最適化を再定式化し、ハイブリッド行動事前制約を持つACT転移型actor-criticアーキテクチャを利用します。
NVIDIAは、自然言語の指示に従って物体を操作できるロボット基盤モデルの厳密な評価という課題に取り組んでいます。同社は、評価が解決すべき重要な未解決問題であると指摘し、これらの課題に対処する新たな手法を発表しました。