Hayden ha desarrollado el arnés knot para gestionar tareas de LLM local de larga duración. Permite flujos de trabajo reutilizables con perfiles de agente, monitoreo de eventos del sistema de archivos y activadores automáticos, utilizando Pi.dev como agente predeterminado.
Flujos de trabajo reutilizables para LLMs locales de larga duración
LLMs agénticos de cero disparos extraen patología pulmonar de narrativas
Un flujo de trabajo agéntico de cero disparos que utiliza LLMs de código abierto extrae 13 campos sinópticos del Colegio Estadounidense de Patólogos a partir de informes de patología de resección pulmonar. El mejor modelo (GPT-OSS-20B) logró un Micro-F1 de 0.893, superando la sensibilidad de referencia y capturando con precisión relaciones patológicas complejas sin entrenamiento específico para la tarea.
Laguna M.1: Modelo MoE de 225B parámetros para codificación agéntica
Laguna M.1 es un modelo mixture-of-experts de 225B parámetros con 23B parámetros activados por token, diseñado para codificación agéntica y tareas de largo alcance. Alcanza un rendimiento competitivo en SWE-bench Verified (74.6%), SWE-bench Multilingual (63.1%) y Terminal-Bench 2.0 (45.8%), superando a modelos como Devstral 2 y GLM-4.7 en benchmarks clave.
Los Agentes de Inteligencia de Datos Habilitan la Consulta Autónoma de Datos
Los Agentes de Inteligencia de Datos (DIA) despliegan agentes de codificación autónomos para optimizar los flujos de trabajo de datos empresariales. El Generador de Consultas iguala o supera los mejores resultados publicados en siete benchmarks de SQL en cuatro dialectos, demostrando generalización a través de instrucciones en lenguaje natural y una arquitectura basada en ejecución.
CAPRA: Sistema de LLM multiagente para retroalimentación de arquitectura de software
CAPRA es un sistema de LLM multiagente que genera retroalimentación en LaTeX personalizada y conforme a plantillas sobre entregables de arquitectura de software. Utiliza agentes especializados, PyMuPDF y gpt-4o para extraer y analizar texto y diagramas UML, con anclaje de evidencia y gestión de consistencia para garantizar la fiabilidad. Una evaluación preliminar de 10 informes estudiantiles muestra que CAPRA cumplió el 88.8% de ocho criterios y logró un acuerdo moderado entre evaluadores (kappa = 0.582), con cada informe procesado en menos de 4 minutos.
Claude Code v2.1.228 corrige la detección de git, el manejo de credenciales y errores de sesión
Se ha lanzado Claude Code versión 2.1.228 con una serie de correcciones de errores y mejoras centradas en la estabilidad y la fiabilidad de las herramientas. La actualización aborda problemas con sesiones interactivas, detección de Git en Windows y mensajería de Control remoto.