ToolGraph mejora los agentes multi-turno que utilizan herramientas integrando topología de esquemas, pesos de transición y controles conscientes del historial. El entrenamiento con DPO en 161 pares de preferencia en puntos de divergencia mejora el rendimiento: ToolGraph+DPO logra una ganancia relativa de recompensa del 16.8% sobre la línea base, especialmente en tareas de aerolíneas y comercio minorista, emergiendo la positividad de la recompensa como la señal diagnóstica clave.
Autoevolución de agentes con capacidad de llamada de herramientas mediante aprendizaje de preferencia en puntos de divergencia
H-RePlan: Recuperación jerárquica para sistemas de agentes multi-dispositivo
H-RePlan introduce un marco de replanificación jerárquica que separa la recuperación de estrategias locales del dispositivo de la replanificación global del orquestador. Supera a las líneas base existentes al lograr una mayor tasa de finalización y adherencia a las instrucciones, con menor costo en tokens, mediante una recuperación consciente del alcance en sistemas de agentes multi-dispositivo.
Act2Answer evalúa la retención de conocimiento en modelos de visión-lenguaje-acción
Act2Answer introduce un protocolo ligero para evaluar la retención de conocimiento del sentido común y del mundo en modelos VLA, requiriendo que los agentes respondan preguntas mediante acciones de colocación de objetos. Un estudio a gran escala de 7 modelos VLA y 9 líneas base VLM revela que los VLA funcionan bien en conceptos simples pero muestran brechas mayores en categorías semánticas ricas en comparación con sus VLMs fuente, con el co-entrenamiento VQA mejorando la retención de conocimiento y señales pico relevantes para la respuesta observadas en las capas intermedias de VLA.
El agente Shippy de Skylight utiliza CLI determinista y sandboxing aislado para consultas marítimas confiables
El equipo de Skylight en Ai2 ha construido Shippy, un agente de IA para la conciencia del dominio marítimo en tiempo real que prioriza la confiabilidad a través de una arquitectura en capas de habilidades, prompts del sistema y configuración. Para garantizar la corrección al consultar datos en vivo, Shippy interactúa con la API de Skylight a través de un CLI diseñado específicamente en lugar de construir llamadas raw, lo que elimina errores sutiles relacionados con la paginación y la codificación de geometría.
Marco LDT-FRL para IoMT ciberresiliente
El marco LDT-FRL introduce un sistema de defensa que preserva la privacidad para dispositivos IoMT, combinando atención temporal, gemelos digitales ligeros y aprendizaje por refuerzo federado. Alcanza una precisión del 99.66% y 99.95% en los benchmarks CICDDoS 2019 y TON-IoT, con F1 perfecto en la clase MITM, converge un 81% más rápido que métodos anteriores y ofrece decisiones de defensa interpretables mediante SHAP y Grad-CAM.
MedBench v5: Benchmark dinámico para IA clínica
MedBench v5 introduce un benchmark dinámico y orientado al proceso para modelos multimodales clínicos, con capacidad de respuesta cognitiva clínica y habilidades atómicas en 63 tareas. Incluye estresores para análisis de degradación y monitorea la propagación de alucinaciones a través de cinco nodos de razonamiento, revelando que un alto rendimiento en tareas no garantiza estabilidad del proceso.