H-RePlan introduce un marco de replanificación jerárquica que separa la recuperación de estrategias locales del dispositivo de la replanificación global del orquestador. Supera a las líneas base existentes al lograr una mayor tasa de finalización y adherencia a las instrucciones, con menor costo en tokens, mediante una recuperación consciente del alcance en sistemas de agentes multi-dispositivo.
H-RePlan: Recuperación jerárquica para sistemas de agentes multi-dispositivo
Act2Answer evalúa la retención de conocimiento en modelos de visión-lenguaje-acción
Act2Answer introduce un protocolo ligero para evaluar la retención de conocimiento del sentido común y del mundo en modelos VLA, requiriendo que los agentes respondan preguntas mediante acciones de colocación de objetos. Un estudio a gran escala de 7 modelos VLA y 9 líneas base VLM revela que los VLA funcionan bien en conceptos simples pero muestran brechas mayores en categorías semánticas ricas en comparación con sus VLMs fuente, con el co-entrenamiento VQA mejorando la retención de conocimiento y señales pico relevantes para la respuesta observadas en las capas intermedias de VLA.
EAGG: Generación de agarres alineada con la representación mediante condicionamiento gráfico consciente de la geometría
EAGG introduce un generador de agarres que alinea la estructura de la representación dentro de un modelo compartido utilizando gráficos conscientes de la topología y tokens conscientes de la geometría. Logra un 56,17% de éxito promedio en MultiGripperGrasp, igualando a modelos especializados dentro de 1,10 puntos porcentuales y reduciendo la distancia media de contacto de 0,239 cm a 0,189 cm.
Mejores modelos locales para razonamiento en IA agente
El creador de EverFern pregunta qué modelos locales funcionan mejor para flujos de trabajo agentes y uso del navegador/ordenador. Señala que la inteligencia del modelo rara vez es el cuello de botella, siendo los sistemas de fiabilidad y recuperación más críticos que la elección del modelo.
Autoevolución de agentes con capacidad de llamada de herramientas mediante aprendizaje de preferencia en puntos de divergencia
ToolGraph mejora los agentes multi-turno que utilizan herramientas integrando topología de esquemas, pesos de transición y controles conscientes del historial. El entrenamiento con DPO en 161 pares de preferencia en puntos de divergencia mejora el rendimiento: ToolGraph+DPO logra una ganancia relativa de recompensa del 16.8% sobre la línea base, especialmente en tareas de aerolíneas y comercio minorista, emergiendo la positividad de la recompensa como la señal diagnóstica clave.
Beaver: Arnés de agente para curación científica a partir de fuentes multimodales
Beaver es un arnés de agente que extrae información estructurada de artículos científicos integrando herramientas de evidencia multimodal, andamiaje de tareas y autoresearch basado en artefactos. Alcanza 81.0 en la Puntuación de Atributos con Referencia Dorada, superando a agentes de vanguardia por más de 23 puntos, con ganancias clave en atributos de alto valor que requieren razonamiento cross-modal.