EAGG introduce un generador de agarres que alinea la estructura de la representación dentro de un modelo compartido utilizando gráficos conscientes de la topología y tokens conscientes de la geometría. Logra un 56,17% de éxito promedio en MultiGripperGrasp, igualando a modelos especializados dentro de 1,10 puntos porcentuales y reduciendo la distancia media de contacto de 0,239 cm a 0,189 cm.
EAGG: Generación de agarres alineada con la representación mediante condicionamiento gráfico consciente de la geometría
H-RePlan: Recuperación jerárquica para sistemas de agentes multi-dispositivo
H-RePlan introduce un marco de replanificación jerárquica que separa la recuperación de estrategias locales del dispositivo de la replanificación global del orquestador. Supera a las líneas base existentes al lograr una mayor tasa de finalización y adherencia a las instrucciones, con menor costo en tokens, mediante una recuperación consciente del alcance en sistemas de agentes multi-dispositivo.
Act2Answer evalúa la retención de conocimiento en modelos de visión-lenguaje-acción
Act2Answer introduce un protocolo ligero para evaluar la retención de conocimiento del sentido común y del mundo en modelos VLA, requiriendo que los agentes respondan preguntas mediante acciones de colocación de objetos. Un estudio a gran escala de 7 modelos VLA y 9 líneas base VLM revela que los VLA funcionan bien en conceptos simples pero muestran brechas mayores en categorías semánticas ricas en comparación con sus VLMs fuente, con el co-entrenamiento VQA mejorando la retención de conocimiento y señales pico relevantes para la respuesta observadas en las capas intermedias de VLA.
Beaver: Arnés de agente para curación científica a partir de fuentes multimodales
Beaver es un arnés de agente que extrae información estructurada de artículos científicos integrando herramientas de evidencia multimodal, andamiaje de tareas y autoresearch basado en artefactos. Alcanza 81.0 en la Puntuación de Atributos con Referencia Dorada, superando a agentes de vanguardia por más de 23 puntos, con ganancias clave en atributos de alto valor que requieren razonamiento cross-modal.
See-and-Reach: Navegación de visión-lenguaje para UAVs en el campo de visión
UAV-VLN-FOV aísla la etapa de ver-y-alcanzar para una evaluación precisa de la navegación de UAV. 3DG-VLN mejora la fundamentación visual y la alineación espacial utilizando pistas de dirección 3D dinámicas, logrando una mejora del 13.82% en la tasa de éxito sobre las líneas base y validado en pruebas del mundo real.
Los Agentes de Inteligencia de Datos Habilitan la Consulta Autónoma de Datos
Los Agentes de Inteligencia de Datos (DIA) despliegan agentes de codificación autónomos para optimizar los flujos de trabajo de datos empresariales. El Generador de Consultas iguala o supera los mejores resultados publicados en siete benchmarks de SQL en cuatro dialectos, demostrando generalización a través de instrucciones en lenguaje natural y una arquitectura basada en ejecución.