MedBench v5 introduce un benchmark dinámico y orientado al proceso para modelos multimodales clínicos, con capacidad de respuesta cognitiva clínica y habilidades atómicas en 63 tareas. Incluye estresores para análisis de degradación y monitorea la propagación de alucinaciones a través de cinco nodos de razonamiento, revelando que un alto rendimiento en tareas no garantiza estabilidad del proceso.
MedBench v5: Benchmark dinámico para IA clínica
Marco LDT-FRL para IoMT ciberresiliente
El marco LDT-FRL introduce un sistema de defensa que preserva la privacidad para dispositivos IoMT, combinando atención temporal, gemelos digitales ligeros y aprendizaje por refuerzo federado. Alcanza una precisión del 99.66% y 99.95% en los benchmarks CICDDoS 2019 y TON-IoT, con F1 perfecto en la clase MITM, converge un 81% más rápido que métodos anteriores y ofrece decisiones de defensa interpretables mediante SHAP y Grad-CAM.
Detección de errores procedimentales con VLMs sin entrenamiento
Un marco unificado de cero disparos, ZeProM, utiliza un Modelo de Video-Lenguaje preentrenado para realizar conjuntamente la detección de errores procedimentales y la segmentación temporal de acciones. Logra una mejora de hasta 4.4 puntos en EDA y 2.0 puntos en F1@.5 en tareas EgoPER, igualando o superando a los métodos supervisados sin entrenamiento específico para la tarea.
Autoevolución de agentes con capacidad de llamada de herramientas mediante aprendizaje de preferencia en puntos de divergencia
ToolGraph mejora los agentes multi-turno que utilizan herramientas integrando topología de esquemas, pesos de transición y controles conscientes del historial. El entrenamiento con DPO en 161 pares de preferencia en puntos de divergencia mejora el rendimiento: ToolGraph+DPO logra una ganancia relativa de recompensa del 16.8% sobre la línea base, especialmente en tareas de aerolíneas y comercio minorista, emergiendo la positividad de la recompensa como la señal diagnóstica clave.
Orden óptimo en el marco de sistemas multiagente
Un nuevo marco analiza los sistemas multiagente modelando las funciones de influencia y respuesta de los agentes. Deriva propiedades macroscópicas como potencia, entropía y orden, e identifica un nivel óptimo de sincronización que equilibra productividad, estabilidad y adaptabilidad. El estudio muestra que el orden y las propiedades del sistema dependen de la tarea y son relativos al contexto.
H-RePlan: Recuperación jerárquica para sistemas de agentes multi-dispositivo
H-RePlan introduce un marco de replanificación jerárquica que separa la recuperación de estrategias locales del dispositivo de la replanificación global del orquestador. Supera a las líneas base existentes al lograr una mayor tasa de finalización y adherencia a las instrucciones, con menor costo en tokens, mediante una recuperación consciente del alcance en sistemas de agentes multi-dispositivo.