OmniAgent introduce un ciclo iterativo Observación-Pensamiento-Acción basado en POMDP para la comprensión de video, permitiendo la ejecución de acciones bajo demanda para destilar selectivamente señales audiovisuales en memoria textual persistente. Alcanza rendimiento de vanguardia en diez benchmarks, con un agente de 7B superando a un modelo Qwen2.5-VL-72B 10× más grande en LVBench (50.5% vs. 47.3%).
OmniAgent: Percepción activa nativa para comprensión omnimodal
Marco de doble agente para traducción verificada entre modelos
Un marco de doble agente convierte protocolos experimentales en lenguaje natural en comandos ejecutables para plataformas robóticas de laboratorio. Utiliza un Agente Analizador y un motor de mapeo basado en reglas para traducir los protocolos, con un Agente de Validación LLM heterogéneo que asegura la precisión e inicia la autocorrección. El marco permite con éxito la ejecución autónoma de extremo a extremo de experimentos basados en placas de microtitulación como el ensayo de Bradford.
AgentFinVQA: QA de gráficos financieros auditable y en las instalaciones
AgentFinVQA introduce una canalización multi-agente para la respuesta a preguntas sobre gráficos financieros que garantiza la auditabilidad y la capacidad de implementación en las instalaciones sin una pérdida significativa de precisión. Supera a los modelos base en +7.68 pp utilizando un backbone propietario y en +4.84 pp con Qwen3.6-27B-FP8 de pesos abiertos, mientras proporciona una señal de confianza a través de la salida del verificador que mejora el enrutamiento de la revisión humana.
OneCanvas: Comprensión de escenas 3D mediante reproyección panorámica
OneCanvas permite la comprensión de escenas 3D en Modelos Visión-Lenguaje agregando características de parches sobre un lienzo panorámico utilizando coordenadas del mundo 3D. Logra resultados de última generación en SQA3D y VSI-Bench, con una fuerte generalización en SPBench, utilizando significativamente menos recursos de entrenamiento que los métodos anteriores.
ViGOS: Desacoplar la percepción y el razonamiento en la auto-distilación multimodal de política activa
ViGOS introduce un marco de auto-distilación de política activa con fundamentos visuales para modelos de lenguaje grande multimodales. Desacopla la percepción y el razonamiento utilizando un maestro solo de imagen para descripciones visuales y un maestro de razonamiento para las salidas finales, reduciendo la dependencia de referencias solo de texto. Este enfoque mejora el rendimiento basado en imágenes en múltiples benchmarks de visión-lenguaje.
ThinkDeception: Marco de detección de engaño multimodal interpretable
ThinkDeception introduce un marco de aprendizaje por refuerzo progresivo que permite la detección de engaño multimodal interpretable. Aprovecha un conjunto de datos de Cadena de Pensamiento anotado paso a paso y propone la Optimización de Política Relativa Grupal Visual-Audio con un currículo dinámico, mejorando la calidad del razonamiento y superando a los métodos existentes en benchmarks principales.