Lagrange introduce un marco disperso basado en energía y de vocabulario abierto para la conducción generalizada de extremo a extremo. Utiliza Modelos Visión-Lenguaje para generar propuestas de objetos independientes de la clase y las codifica en tokens semánticos continuos, lo que permite una generalización robusta a escenarios anómalos mientras se adhiere a la cinemática del vehículo mediante la minimización de la acción lagrangiana.
Lagrange: Marco disperso de vocabulario abierto para conducción de extremo a extremo
Marco de doble agente para traducción verificada entre modelos
Un marco de doble agente convierte protocolos experimentales en lenguaje natural en comandos ejecutables para plataformas robóticas de laboratorio. Utiliza un Agente Analizador y un motor de mapeo basado en reglas para traducir los protocolos, con un Agente de Validación LLM heterogéneo que asegura la precisión e inicia la autocorrección. El marco permite con éxito la ejecución autónoma de extremo a extremo de experimentos basados en placas de microtitulación como el ensayo de Bradford.
Pose6DAug: Intercambio de objetos multi-vista físicamente plausible
Pose6DAug permite la augmentación de datos robóticos intercambiando objetos en episodios exitosos mientras se preservan trayectorias de poses 6D físicamente válidas. Opera en 3D utilizando una malla anclada por poses temporalmente coherentes, asegurando consistencia multi-vista y plausibilidad física. El ajuste fino de una política VLA con estos datos aumentados mejora las tasas de éxito para objetos nuevos en un 16.5% respecto a las líneas base más avanzadas.
OneCanvas: Comprensión de escenas 3D mediante reproyección panorámica
OneCanvas permite la comprensión de escenas 3D en Modelos Visión-Lenguaje agregando características de parches sobre un lienzo panorámico utilizando coordenadas del mundo 3D. Logra resultados de última generación en SQA3D y VSI-Bench, con una fuerte generalización en SPBench, utilizando significativamente menos recursos de entrenamiento que los métodos anteriores.
ViGOS: Desacoplar la percepción y el razonamiento en la auto-distilación multimodal de política activa
ViGOS introduce un marco de auto-distilación de política activa con fundamentos visuales para modelos de lenguaje grande multimodales. Desacopla la percepción y el razonamiento utilizando un maestro solo de imagen para descripciones visuales y un maestro de razonamiento para las salidas finales, reduciendo la dependencia de referencias solo de texto. Este enfoque mejora el rendimiento basado en imágenes en múltiples benchmarks de visión-lenguaje.
ThinkDeception: Marco de detección de engaño multimodal interpretable
ThinkDeception introduce un marco de aprendizaje por refuerzo progresivo que permite la detección de engaño multimodal interpretable. Aprovecha un conjunto de datos de Cadena de Pensamiento anotado paso a paso y propone la Optimización de Política Relativa Grupal Visual-Audio con un currículo dinámico, mejorando la calidad del razonamiento y superando a los métodos existentes en benchmarks principales.