Robotics
media MarkTechPost · hace 9 d · 2 vistas

Google DeepMind lanza Gemini Robotics 2 para el control de cuerpo completo y la destreza

Google DeepMind ha lanzado Gemini Robotics 2, una capa de inteligencia que comprende tres modelos diseñados para habilitar el control de cuerpo completo, la destreza de cinco dedos y la colaboración entre múltiples robots. El lanzamiento incluye un modelo Vision-Language-Action (VLA), un VLM de razonamiento encarnado y un VLA en el dispositivo, superando las capacidades anteriores de manipulación en mesa.

lab Google DeepMind Blog · hace 10 d · 4 vistas

Google presenta Gemini Robotics 2 para el control de todo el cuerpo y la colaboración entre múltiples robots

Google ha presentado Gemini Robotics 2, una capa de inteligencia diseñada para proporcionar a los robots adaptables un control inteligente de todo el cuerpo, destreza avanzada y la capacidad de colaborar en equipos. Esta actualización expande las capacidades de la IA física más allá de tareas estrechas y repetitivas, permitiendo a los robots razonar sobre los movimientos y adaptarse rápidamente a nuevos cuerpos.

lab Google DeepMind Blog · hace 10 d · 9 vistas

Google lanza Gemini Robotics ER 2 con comprensión de video y colaboración entre múltiples robots

Google ha lanzado Gemini Robotics ER 2, un nuevo modelo de razonamiento encarnado diseñado para ayudar a los robots a pensar rápido y planificar tareas en varios pasos en tiempo real. La actualización introduce mejoras significativas respecto a la versión anterior ER 1.6, incluyendo seguimiento continuo del progreso basado en video, localización precisa de momentos y capacidades nativas de colaboración entre múltiples robots.

media Hugging Face Forums · hace 12 d · 2 vistas

Calibra: kit de herramientas de código abierto para la observabilidad de conjuntos de datos de robots

Calibra es un kit de herramientas de código abierto diseñado para ayudar a los investigadores a auditar conjuntos de datos de robots e identificar problemas de calidad antes de entrenar políticas. El primer lanzamiento público incluye un Espacio interactivo Robot Dataset Health Check para auditar conjuntos de datos LeRobot y una evaluación comparativa de 30 conjuntos de datos públicos de LeRobot con puntuaciones de salud.

lab Meta AI / FAIR Blog · hace 13 d · 3 vistas

La Universidad de Pittsburgh utiliza DINOv3 y SAM de Meta para el robot asistencial ARPA-H financiado por RAMMP

Los Laboratorios de Investigación en Ingeniería Humana (HERL) de la Universidad de Pittsburgh están liderando la Plataforma Robótica de Movilidad y Manipulación Asistencial que Proporciona Independencia a Personas con Discapacidades (RAMMP), un proyecto respaldado por hasta $41.5 millones en financiación de ARPA-H. La iniciativa tiene como objetivo crear soluciones de movilidad asistencial más seguras y adaptables para usuarios de sillas de ruedas, integrando robótica avanzada con modelos de visión por IA de código abierto de Meta.

lab Hugging Face Blog · hace 13 d · 19 vistas

NVIDIA presenta Cosmos-H-Dreams, un simulador generativo en tiempo real para robótica quirúrgica

NVIDIA ha presentado Cosmos-H-Dreams, un simulador generativo en tiempo real y condicionado por acciones para robótica quirúrgica que destila las capacidades de su Cosmos-H-Surgical-Simulator en un modelo estudiante causal. Servido a través de la biblioteca FlashDreams de NVIDIA para inferencia acelerada con streaming, el sistema permite el control interactivo por una persona o una política aprendida en un bucle cerrado.

lab Hugging Face Blog · hace 19 d · 8 vistas

Visión general de los motores de simulación para IA física: MuJoCo, Isaac Sim y Newton

Este artículo ofrece una visión general del estado actual de la simulación en IA física, explicando cómo la simulación cierra la brecha de datos para la robótica al permitir entornos de entrenamiento escalables y fotorrealistas. Describe un paradigma de tres computadoras (entrenamiento, simulación y en el robot) y clasifica los motores de simulación clave según sus capacidades específicas y casos de uso.

media MarkTechPost · hace 19 d · 4 vistas

NVIDIA lanza Cosmos 3 Edge, un modelo de mundo abierto de 4B para razonamiento robótico en dispositivo

NVIDIA ha lanzado Cosmos 3 Edge, un modelo de mundo abierto de 4 mil millones de parámetros diseñado para ejecutarse en dispositivo para robots y agentes de visión por IA. Lanzado el 20 de julio en Hugging Face, permite a los sistemas comprender el entorno, razonar en tiempo real y generar acciones robóticas localmente sin dependencia de la nube.

lab Hugging Face Blog · hace 19 d · 2 vistas

Pollen Robotics lanza Grabette, un sistema abierto y de bajo costo para grabar datos de manipulación robótica

Pollen Robotics ha lanzado Grabette, un dispositivo portátil de código abierto diseñado para grabar datos de manipulación robótica del mundo real sin requerir un robot o equipo de teleoperación. El sistema utiliza una cámara gran angular y una cámara de profundidad RGBD para capturar trayectorias de 6-DoF, permitiendo a los usuarios generar conjuntos de datos limpios que pueden procesarse mediante un panel de control basado en navegador y compartirse en el Hugging Face Hub.

lab Hugging Face Blog · hace 20 d · 1 vista

NVIDIA lanza Cosmos 3 Edge, un modelo de 4B parámetros para control robótico en tiempo real en dispositivos edge

NVIDIA ha lanzado Cosmos 3 Edge, un modelo de mundo abierto de 4 mil millones de parámetros diseñado para ofrecer rendimiento a nivel de centro de datos en sistemas edge con memoria limitada. El modelo permite que los robots y agentes de visión por IA entiendan su entorno, razonen en tiempo real y generen acciones directamente en dispositivos como los módulos NVIDIA Jetson.

arxiv arXiv cs.LG · hace 23 d · 2 vistas

RoboTTT escala las políticas de robots a un contexto de 8K pasos de tiempo

Los investigadores presentan RoboTTT, una receta de entrenamiento que extiende el contexto visuomotor para modelos base de robots hasta 8.000 pasos de tiempo sin aumentar la latencia de inferencia. El método integra el Entrenamiento en Tiempo de Prueba (Test-Time Training) en políticas Visión-Lenguaje-Acción mediante el uso de pesos rápidos actualizados por descenso de gradiente durante tanto el entrenamiento como la inferencia.

arxiv arXiv cs.AI · hace 23 d

RoboTTT escala las políticas de robots a un contexto de 8K pasos de tiempo

NVIDIA presenta RoboTTT, un modelo base para robótica y una receta de entrenamiento que extiende el contexto visuomotor a 8.000 pasos de tiempo sin aumentar la latencia de inferencia. Al integrar el Entrenamiento en Tiempo de Prueba (Test-Time Training) en políticas Visión-Lenguaje-Acción, el sistema comprime el historial en el espacio de pesos mediante pesos rápidos actualizados por descenso de gradiente.

arxiv arXiv cs.AI · hace 23 d SWE-bench Pro · 63.2%

Xiaomi lanza U0, un modelo de 38B parámetros para síntesis corporal unificada

Xiaomi ha presentado Xiaomi-Robotics-U0, un modelo autoregresivo multimodal de 38 mil millones de parámetros diseñado para la síntesis corporal unificada. El modelo trata la generación corporal como una extensión de la generación de imágenes y video de base, optimizando conjuntamente la generación de texto a imagen, la edición de imágenes, la generación de escenas corporales, la transferencia corporal y la generación de video corporal.

arxiv arXiv cs.AI · hace 27 d · 1 vista

El marco de postentrenamiento PAC-ACT mejora las políticas ACT para manipulación de contacto de precisión

Este artículo presenta PAC-ACT, un marco de postentrenamiento basado en aprendizaje por refuerzo diseñado para mejorar las políticas preentrenadas de Action Chunking Transformer (ACT) para tareas industriales de contacto de precisión. El método reformula la optimización de políticas a nivel de chunk y utiliza una arquitectura actor-crítico transferida con ACT junto con una restricción híbrida de prior de comportamiento.