WEQA presenta un marco de agentes adaptativos a la consulta que combina modelos de lenguaje con herramientas especializadas de análisis de datos de dispositivos portátiles. Supera a las líneas base de LLM y agentes en un 24% en precisión y demuestra una utilidad mejorada y solidez clínica en evaluaciones de expertos y usuarios.
WEQA: Respuesta a preguntas de salud con dispositivos portátiles mediante razonamiento agente adaptativo a la consulta
Marco de doble agente para traducción verificada entre modelos
Un marco de doble agente convierte protocolos experimentales en lenguaje natural en comandos ejecutables para plataformas robóticas de laboratorio. Utiliza un Agente Analizador y un motor de mapeo basado en reglas para traducir los protocolos, con un Agente de Validación LLM heterogéneo que asegura la precisión e inicia la autocorrección. El marco permite con éxito la ejecución autónoma de extremo a extremo de experimentos basados en placas de microtitulación como el ensayo de Bradford.
OneCanvas: Comprensión de escenas 3D mediante reproyección panorámica
OneCanvas permite la comprensión de escenas 3D en Modelos Visión-Lenguaje agregando características de parches sobre un lienzo panorámico utilizando coordenadas del mundo 3D. Logra resultados de última generación en SQA3D y VSI-Bench, con una fuerte generalización en SPBench, utilizando significativamente menos recursos de entrenamiento que los métodos anteriores.
ViGOS: Desacoplar la percepción y el razonamiento en la auto-distilación multimodal de política activa
ViGOS introduce un marco de auto-distilación de política activa con fundamentos visuales para modelos de lenguaje grande multimodales. Desacopla la percepción y el razonamiento utilizando un maestro solo de imagen para descripciones visuales y un maestro de razonamiento para las salidas finales, reduciendo la dependencia de referencias solo de texto. Este enfoque mejora el rendimiento basado en imágenes en múltiples benchmarks de visión-lenguaje.
ThinkDeception: Marco de detección de engaño multimodal interpretable
ThinkDeception introduce un marco de aprendizaje por refuerzo progresivo que permite la detección de engaño multimodal interpretable. Aprovecha un conjunto de datos de Cadena de Pensamiento anotado paso a paso y propone la Optimización de Política Relativa Grupal Visual-Audio con un currículo dinámico, mejorando la calidad del razonamiento y superando a los métodos existentes en benchmarks principales.
LEADS: Descubrimiento agéntico de modelos híbridos para la electrofisiología cardíaca
LEADS propone un marco que utiliza un agente LLM para descubrir modelos híbridos de electrofisiología cardíaca a través de un bucle iterativo de razonamiento y acción. Formula el conocimiento del dominio como un espacio de acciones estructurado, permitiendo diseños de modelos físicamente fundamentados, interpretables y numéricamente estables, superando tanto a los diseñados por humanos como a otros enfoques basados en LLM en datos cardíacos sintéticos y reales.