Un proyecto de investigación explora el uso de instrucciones tácticas en lenguaje natural proporcionadas por humanos para guiar agentes de IA autónomos en una simulación de fútbol. El sistema permite a los entrenadores humanos emitir directivas de alto nivel como 'presionar agresivamente' o 'explotar el lado izquierdo', que los agentes de IA adaptan en tiempo real dentro de un entorno dinámico y basado en equipos.
Proyecto de investigación: Inyección de intención táctica en lenguaje natural en políticas de agentes múltiples para fútbol
Gazer: Corrección semántica sin entrenamiento para modelos visuales autoregresivos
Gazer introduce un marco de trabajo sin entrenamiento que utiliza retroalimentación de modelos de lenguaje grande multimodales para corregir errores semánticos en tiempo real durante la generación de modelos visuales autoregresivos. Al integrar etapas de diagnóstico reflexivo y corrección semántica, Gazer mejora la precisión composicional y la alineación semántica en múltiples modelos sin entrenamiento adicional.
Desacoplar el conocimiento declarativo y procedimental en modelos de visión-lenguaje-acción
w$^{2}$VLA introduce un enfoque modular que desacopla el conocimiento declarativo y procedimental en los modelos de visión-lenguaje-acción. Al reestructurar el flujo de información, permite una clonación de comportamiento robusta y una transferencia de habilidades cero-shot sin precedentes a través de objetos no vistos y disímiles.
Desacoplar el conocimiento declarativo y procedimental en modelos de visión-lenguaje-acción
w$^{2}$VLA introduce un modelo modular de visión-lenguaje-acción que desacopla el conocimiento declarativo y procedimental. Al reestructurar el flujo de información, permite una clonación de comportamiento robusta y la transferencia de habilidades zero-shot a objetos nuevos y disímiles.
Dementia-Agents: Sistema multiagente multimodal para la estadificación de la demencia
Dementia-Agents presenta un marco multiagente alineado clínicamente para la estadificación y fenotipado de la demencia en el mundo real. Mejora el rendimiento diagnóstico frente a modelos monolíticos y sistemas previos, manteniendo la interpretabilidad a nivel de dominio, utilizando datos de 1,066 pacientes de dos servicios de neurología cognitiva.
AllenAI lanza los modelos de visión MolmoMotion para predicción de movimiento futuro
AllenAI ha lanzado dos modelos MolmoMotion que predicen trayectorias de puntos 3D basadas en historias de video cortas e instrucciones en lenguaje natural. Un modelo utiliza una historia de tres fotogramas, el otro una historia de un solo fotograma, lo que permite la predicción de movimiento futuro para objetos en el espacio 3D.