Un flujo de trabajo agéntico de cero disparos que utiliza LLMs de código abierto extrae 13 campos sinópticos del Colegio Estadounidense de Patólogos a partir de informes de patología de resección pulmonar. El mejor modelo (GPT-OSS-20B) logró un Micro-F1 de 0.893, superando la sensibilidad de referencia y capturando con precisión relaciones patológicas complejas sin entrenamiento específico para la tarea.
LLMs agénticos de cero disparos extraen patología pulmonar de narrativas
CAPRA: Sistema de LLM multiagente para retroalimentación de arquitectura de software
CAPRA es un sistema de LLM multiagente que genera retroalimentación en LaTeX personalizada y conforme a plantillas sobre entregables de arquitectura de software. Utiliza agentes especializados, PyMuPDF y gpt-4o para extraer y analizar texto y diagramas UML, con anclaje de evidencia y gestión de consistencia para garantizar la fiabilidad. Una evaluación preliminar de 10 informes estudiantiles muestra que CAPRA cumplió el 88.8% de ocho criterios y logró un acuerdo moderado entre evaluadores (kappa = 0.582), con cada informe procesado en menos de 4 minutos.
ALeRCE lanza un sistema de texto a SQL con LLMs
La base de datos astronómica ALeRCE presenta un sistema de texto a SQL que utiliza modelos de lenguaje grandes, permitiendo consultas en lenguaje natural para generar SQL ejecutable. El sistema, evaluado en 110 pares NL/SQL, emplea un marco paso a paso que supera las líneas base de inferencia directa, con Claude Opus 4.6 logrando alta precisión en consultas simples y uno de los mejores rendimientos generales entre los modelos evaluados.
Fingerprinting del comportamiento de agentes mediante trayectorias procedimentales
Presentamos un método para identificar agentes por sus huellas dactilares de comportamiento procedimental, logrando una precisión del 85.7% al atribuir trayectorias no vistas a los agentes correctos. Utilizando ProcGrep, analizamos el comportamiento de agentes de codificación en SWE-Bench, descubriendo que los modelos de períodos de lanzamiento similares o destilados entre sí exhiben una similitud de comportamiento más cercana, con una divergencia Jensen-Shannon de 0.25.
La minería de trayectorias revela la estructura de habilidades pero no mejora las políticas
Una tubería de tres etapas extrae bibliotecas de habilidades a partir de datos de interacción con GUI, logrando una alta pureza en cinco de los ocho clústeres frente a las etiquetas de InteraSkill. Sin embargo, el método solo mejora ligeramente la precisión de pasos de habilidad en IW y no logra avanzar el rendimiento en BrowseComp+ ni en métricas clave, lo que indica limitaciones en la transferencia de políticas entre dominios.
AutoPass: Agentes LLM guiados por evidencia para el ajuste de rendimiento del compilador
AutoPass utiliza evidencia en tiempo de ejecución y del compilador para guiar las decisiones de optimización generadas por LLM, superando a heurísticas expertas y métodos clásicos de autotuneo. Logra aceleraciones geométricas medias de 1.043x en sistemas x86-64 y 1.117x en sistemas ARM64 sin entrenamiento previo ni ajuste fino.