AgentFinVQA introduce una canalización multi-agente para la respuesta a preguntas sobre gráficos financieros que garantiza la auditabilidad y la capacidad de implementación en las instalaciones sin una pérdida significativa de precisión. Supera a los modelos base en +7.68 pp utilizando un backbone propietario y en +4.84 pp con Qwen3.6-27B-FP8 de pesos abiertos, mientras proporciona una señal de confianza a través de la salida del verificador que mejora el enrutamiento de la revisión humana.
AgentFinVQA: QA de gráficos financieros auditable y en las instalaciones
AutoPass: Agentes LLM guiados por evidencia para el ajuste de rendimiento del compilador
AutoPass utiliza evidencia en tiempo de ejecución y del compilador para guiar las decisiones de optimización generadas por LLM, superando a heurísticas expertas y métodos clásicos de autotuneo. Logra aceleraciones geométricas medias de 1.043x en sistemas x86-64 y 1.117x en sistemas ARM64 sin entrenamiento previo ni ajuste fino.
LLM-as-Interface, ML-as-Predictor para Apendicitis Pediátrica
ClaMPAPP, un sistema híbrido, utiliza un LLM para extraer características clínicas estructuradas de notas en texto libre y las pasa a un clasificador XGBoost para el diagnóstico. Superó a los LLMs end-to-end tanto en validación interna como externa, con mejor rendimiento diagnóstico y menos casos pasados por alto, demostrando mayor estabilidad y seguridad en la triaje de apendicitis pediátrica.
OmniAgent: Percepción activa nativa para comprensión omnimodal
OmniAgent introduce un ciclo iterativo Observación-Pensamiento-Acción basado en POMDP para la comprensión de video, permitiendo la ejecución de acciones bajo demanda para destilar selectivamente señales audiovisuales en memoria textual persistente. Alcanza rendimiento de vanguardia en diez benchmarks, con un agente de 7B superando a un modelo Qwen2.5-VL-72B 10× más grande en LVBench (50.5% vs. 47.3%).
HandwritingAgent: Síntesis de escritura a mano impulsada por lenguaje en SVG
HandwritingAgent sintetiza escritura a mano natural en formato SVG sin entrenamiento específico de estilo. Utiliza un modelo de razonamiento grande para generar secuencias de trazos en un lienzo en cuadrícula, condicionado por la entrada de texto y una imagen de referencia de estilo, lo que permite una generación de escritura a mano eficiente, controlable y generalizable.
Fingerprinting del comportamiento de agentes mediante trayectorias procedimentales
Presentamos un método para identificar agentes por sus huellas dactilares de comportamiento procedimental, logrando una precisión del 85.7% al atribuir trayectorias no vistas a los agentes correctos. Utilizando ProcGrep, analizamos el comportamiento de agentes de codificación en SWE-Bench, descubriendo que los modelos de períodos de lanzamiento similares o destilados entre sí exhiben una similitud de comportamiento más cercana, con una divergencia Jensen-Shannon de 0.25.