El Modelo de Acción Geométrica (GAM) permite que las políticas robóticas razonen sobre interacciones físicas en 3D mediante la reutilización de un modelo base geométrico preentrenado. GAM divide el GFM para servir como codificador de observaciones y predictor causal del futuro, luego enruta la geometría futura y las acciones predichas a través del mismo backbone, logrando un rendimiento preciso, robusto y eficiente en manipulación en simulación y benchmarks con robots reales.
Modelo de Acción Geométrica para el Aprendizaje de Políticas Robóticas
El ajuste fino de modelos VLA requiere menos capas de lo pensado
Los modelos Visión-Lenguaje-Acción muestran una redundancia capa por capa severa a pesar de los grandes conteos de parámetros. Un método de compresión sin entrenamiento que utiliza Alineación del Núcleo Centrado elimina capas gemelas, reduciendo la profundidad del modelo hasta un 50% y permitiendo un entrenamiento 40-50% más rápido y una inferencia hasta un 30% más rápida sin pérdida de rendimiento, validado en tareas robóticas de simulación y del mundo real.
La resistencia de la memoria flash como capital depreciado en la memoria del robot
La memoria flash de un robot se degrada con cada escritura, formando un activo no renovable. Un modelo de precios consciente del desgaste utiliza un precio sombra $η$ para guiar la colocación de la memoria entre RAM, NVM y la nube, con el enrutamiento óptimo dependiendo de si el valor de la tarea aumenta con la persistencia de la memoria. El signo de la asociación valor-escritura $χ$ varía según el despliegue: positivo en manipulación de largo horizonte, nulo en tareas de corto horizonte y negativo en teleoperación. El presupuesto de resistencia es vinculante solo en memoria QLC/eMMC de gama baja, y aunque el enrutamiento consciente del desgaste se alinea con el valor de la tarea, las mejoras reales de rendimiento permanecen sin verificar en los datos.
La resistencia de la memoria flash como capital depreciado en la memoria del robot
La resistencia de la memoria flash de un robot es un activo no renovable que se degrada con cada escritura. Un modelo de precios consciente del desgaste introduce un precio sombra $η$ para guiar la colocación de la memoria entre RAM, NVM y la nube, con el enrutamiento óptimo dependiendo de la asociación valor-escritura $χ$. Las mediciones empíricas muestran que $χ$ es positivo en manipulación a largo plazo, nulo en tareas a corto plazo y negativo en teleoperación, y el presupuesto de resistencia es limitante solo en memoria QLC/eMMC de gama baja, donde el control consciente del desgaste influye en el enrutamiento basado en el valor de la tarea sin mejorar el rendimiento.
Visión general de los motores de simulación para IA física: MuJoCo, Isaac Sim y Newton
Este artículo ofrece una visión general del estado actual de la simulación en IA física, explicando cómo la simulación cierra la brecha de datos para la robótica al permitir entornos de entrenamiento escalables y fotorrealistas. Describe un paradigma de tres computadoras (entrenamiento, simulación y en el robot) y clasifica los motores de simulación clave según sus capacidades específicas y casos de uso.
RoboTTT escala las políticas de robots a un contexto de 8K pasos de tiempo
Los investigadores presentan RoboTTT, una receta de entrenamiento que extiende el contexto visuomotor para modelos base de robots hasta 8.000 pasos de tiempo sin aumentar la latencia de inferencia. El método integra el Entrenamiento en Tiempo de Prueba (Test-Time Training) en políticas Visión-Lenguaje-Acción mediante el uso de pesos rápidos actualizados por descenso de gradiente durante tanto el entrenamiento como la inferencia.