OneCanvas permite la comprensión de escenas 3D en Modelos Visión-Lenguaje agregando características de parches sobre un único lienzo panorámico utilizando coordenadas del mundo 3D. Alcanza rendimiento de vanguardia en SQA3D y VSI-Bench, y se generaliza a datos fuera de distribución en SPBench, utilizando significativamente menos capacidad de entrenamiento que los métodos existentes.
OneCanvas: Comprensión de escenas 3D mediante reproyección panorámica
See-and-Reach: Navegación de visión-lenguaje para UAVs en el campo de visión
UAV-VLN-FOV aísla la etapa de ver-y-alcanzar para una evaluación precisa de la navegación de UAV. 3DG-VLN mejora la fundamentación visual y la alineación espacial utilizando pistas de dirección 3D dinámicas, logrando una mejora del 13.82% en la tasa de éxito sobre las líneas base y validado en pruebas del mundo real.
Evolución oculta del contexto visual disfrazado en VLMs
Los tokens visuales ingresan a los modelos de lenguaje grandes como señales crudas y no estructuradas. Su transformación e integración internas dependen de la arquitectura, ya sea como prompts in-context o inyectados en capas intermedias, lo que conduce a distintas trayectorias evolutivas en la representación visual y las características de frecuencia. Encontramos que la atención por sí sola es insuficiente; el rendimiento está impulsado por la calidad de las representaciones visuales en cada capa a través de diferentes paradigmas de integración.
Beaver: Arnés de agente para curación científica a partir de fuentes multimodales
Beaver es un arnés de agente que extrae información estructurada de artículos científicos integrando herramientas de evidencia multimodal, andamiaje de tareas y autoresearch basado en artefactos. Alcanza 81.0 en la Puntuación de Atributos con Referencia Dorada, superando a agentes de vanguardia por más de 23 puntos, con ganancias clave en atributos de alto valor que requieren razonamiento cross-modal.
H-RePlan: Recuperación jerárquica para sistemas de agentes multi-dispositivo
H-RePlan introduce un marco de replanificación jerárquica que separa la recuperación de estrategias locales del dispositivo de la replanificación global del orquestador. Supera a las líneas base existentes al lograr una mayor tasa de finalización y adherencia a las instrucciones, con menor costo en tokens, mediante una recuperación consciente del alcance en sistemas de agentes multi-dispositivo.
Protocolo VLM-as-3D-Judge de-biased para Generación de Muebles
Un protocolo de juez basado en VLM de-biased especializa TRELLIS en la generación de muebles mediante adaptación ligera. El protocolo aborda modos de fallo como sobrecarga de imagen y ocultamiento de geometría, con calibración que muestra tasas de victoria de 0.83–1.0 y simetría base-vs-base en 0.5. Entre seis métodos de adaptación, la reparación del condicionador bajo degradación severa alcanza paridad con el modelo base, mientras que ningún método supera el objetivo de tasa de victoria del 65%.