El artículo presenta RECALL, un paradigma de aprendizaje activo y continuo para modelos Visión-Lenguaje-Acción que aborda las ineficiencias del aprendizaje por imitación pasiva. A diferencia de los métodos tradicionales que requieren fallos del robot para desencadenar la recolección de datos, este enfoque utiliza demostraciones de recuperación guiadas por incertidumbre para identificar proactivamente los estados que necesitan supervisión. Los autores demuestran que esta recolección de datos dirigida conduce a un ajuste fino más eficiente en comparación con las demostraciones recopiladas pasivamente. Sin embargo, el estudio revela que el ajuste fino exclusivamente con estos datos activos de recuperación provoca un olvido catastrófico de los comportamientos aprendidos previamente. Para mitigar este problema, el trabajo evalúa técnicas de aprendizaje continuo como la mezcla de datos basada en replay y la consolidación elástica de pesos. Estos experimentos destacan las compensaciones críticas entre la plasticidad para nuevas tareas y la retención de capacidades existentes en VLAs autoregresivos. En última instancia, la investigación establece que, aunque la recuperación guiada por incertidumbre mejora la eficiencia de adaptación, incorporar datos nuevos dirigidos a grandes políticas robóticas presenta desafíos abiertos significativos.
RECALL: Aprendizaje Activo Continuo para Modelos Visión-Lenguaje-Acción
Dyna Robotics lanza Dyna-2, un modelo de acción mundial preentrenado con 1 millón de horas de video humano
Dyna Robotics ha lanzado Dyna-2, un modelo de acción mundial para manipulación robótica que fue preentrenado con más de un millón de horas de video egocéntrico humano. La empresa demuestra que el video humano ordinario puede sustituir a los datos etiquetados con acciones al establecer una ley de escalado desde 1.000 hasta 1.000.000 de horas.
Visión general de los motores de simulación para IA física: MuJoCo, Isaac Sim y Newton
Este artículo ofrece una visión general del estado actual de la simulación en IA física, explicando cómo la simulación cierra la brecha de datos para la robótica al permitir entornos de entrenamiento escalables y fotorrealistas. Describe un paradigma de tres computadoras (entrenamiento, simulación y en el robot) y clasifica los motores de simulación clave según sus capacidades específicas y casos de uso.
RoboTTT escala las políticas de robots a un contexto de 8K pasos de tiempo
Los investigadores presentan RoboTTT, una receta de entrenamiento que extiende el contexto visuomotor para modelos base de robots hasta 8.000 pasos de tiempo sin aumentar la latencia de inferencia. El método integra el Entrenamiento en Tiempo de Prueba (Test-Time Training) en políticas Visión-Lenguaje-Acción mediante el uso de pesos rápidos actualizados por descenso de gradiente durante tanto el entrenamiento como la inferencia.
RoboTTT escala las políticas de robots a un contexto de 8K pasos de tiempo
NVIDIA presenta RoboTTT, un modelo base para robótica y una receta de entrenamiento que extiende el contexto visuomotor a 8.000 pasos de tiempo sin aumentar la latencia de inferencia. Al integrar el Entrenamiento en Tiempo de Prueba (Test-Time Training) en políticas Visión-Lenguaje-Acción, el sistema comprime el historial en el espacio de pesos mediante pesos rápidos actualizados por descenso de gradiente.
RECALL: Colección de Experiencias de Recuperación para Aprendizaje Continuo Activo en Modelos Visión-Lenguaje-Acción
Este artículo propone un paradigma de aprendizaje continuo activo para modelos Visión-Lenguaje-Acción (VLA) con el fin de abordar las ineficiencias del aprendizaje por imitación pasiva. Los autores demuestran que la recolección de datos guiada por incertidumbre mejora la eficiencia del ajuste fino, pero provoca un olvido catastrófico cuando se utilizan exclusivamente los datos de recuperación.