Microsoft ha liberado como código abierto FastContext-1.0, un subagente ligero de exploración de repositorios que separa la exploración del repositorio de código de la resolución de tareas en agentes de codificación LLM. Utiliza llamadas de herramientas paralelas solo de lectura para devolver rutas de archivo compactas y rangos de líneas, mejorando la precisión de extremo a extremo y reduciendo el uso de tokens hasta un 60.3%, con el modelo 4B-RL superando a un modelo 30B-SFT en SWE-bench Pro.
Microsoft lanza FastContext de código abierto para agentes de codificación LLM
Los Agentes de Inteligencia de Datos Habilitan la Consulta Autónoma de Datos
Los Agentes de Inteligencia de Datos (DIA) despliegan agentes de codificación autónomos para optimizar los flujos de trabajo de datos empresariales. El Generador de Consultas iguala o supera los mejores resultados publicados en siete benchmarks de SQL en cuatro dialectos, demostrando generalización a través de instrucciones en lenguaje natural y una arquitectura basada en ejecución.
Microsoft Research lanza Flint, un lenguaje de visualización para la creación de gráficos impulsada por IA
Microsoft Research ha presentado Flint, un lenguaje intermedio de visualización de código abierto diseñado para ayudar a los agentes de IA a generar gráficos expresivos y visualmente pulidos a partir de especificaciones simples editables por humanos. El sistema aborda el compromiso entre parámetros de bajo nivel verbosos y frágiles y salidas predeterminadas poco inspiradoras mediante el uso de tipos de datos semánticos para derivar automáticamente escalas, diseños y formatos optimizados.
GitHub Copilot LLM Gateway permite BYOK para finalización en línea
GitHub Copilot permite Bring Your Own Key (BYOK) para su ventana de chat pero bloquea explícitamente el uso de esos modelos personalizados para la autocompletación de código en línea. La justificación oficial del equipo de VS Code es una supuesta falta de modelos Fill-in-the-Middle (FIM) capaces, una afirmación que el autor disputa como un cambio de culpa incorrecto.
Metis: Uniendo la memoria de texto y código para agentes autoevolutivos
Metis introduce una memoria dual jerárquica que combina memoria de texto y código para mejorar los agentes autoevolutivos. Organiza la experiencia en planes de ejecución, hechos y trampas, cristalizando los planes reutilizables en herramientas validadas solo cuando está justificado. Evaluado en AppWorld, Metis logra hasta un 20.6% más de precisión en tareas y un 22.8% menos de costo de ejecución que ReAct, con un mejor equilibrio general entre precisión, eficiencia y costo de memoria.
NatureBench evalúa las capacidades de descubrimiento científico de los agentes de codificación de IA
NatureBench presenta una batería de 90 tareas basadas en artículos de la familia Nature para evaluar la capacidad de los agentes de codificación de IA para lograr descubrimientos científicos. Bajo un protocolo con búsqueda web deshabilitada, el mejor modelo supera el estado del arte anterior solo en el 17.8% de las tareas. Los agentes tienen éxito principalmente al traducir problemas científicos en tareas de aprendizaje supervisado, no mediante invención científica original.