Microsoft выпустил FastContext-1.0, легкий подагент для исследования репозиториев кода, который отделяет исследование репозиториев кода от решения задач в агентах кодирования на основе LLM. Он использует параллельные только для чтения вызовы инструментов для возврата компактных путей к файлам и диапазонов строк, что улучшает общую точность и снижает использование токенов на 60,3%, при этом модель 4B-RL превосходит модель 30B-SFT по SWE-bench Pro.
Microsoft выпустил открытый исходный код FastContext для агентов кодирования на основе LLM
Агенты интеллектуального анализа данных обеспечивают автономный запрос данных
Агенты интеллектуального анализа данных (DIA) развертывают автономных агентов программирования для оптимизации рабочих процессов с данными в корпоративной среде. Генератор запросов достигает или превосходит лучшие публикуемые результаты на семи бенчмарках SQL по четырём синтаксисам, демонстрируя обобщение через естественные инструкции и архитектуру выполнения запросов.
Исследовательская лаборатория Microsoft выпустила Flint — язык визуализации для создания диаграмм на базе ИИ
Исследовательская лаборатория Microsoft представила Flint, открытый промежуточный язык визуализации, предназначенный для помощи ИИ-агентам в создании выразительных и визуально отполированных диаграмм по простым, редактируемым человеком спецификациям. Система решает проблему компромисса между многословными хрупкими низкоуровневыми параметрами и не вдохновляющими значениями по умолчанию за счёт использования семантических типов данных для автоматического вывода оптимизированных масштабов, макетов и форматирования.
GitHub Copilot LLM Gateway позволяет BYOK для встроенного завершения
GitHub Copilot позволяет использовать Bring Your Own Key (BYOK) для окна чата, но явно блокирует использование этих пользовательских моделей для встроенного автозавершения кода. Официальное обоснование от команды VS Code — предполагаемое отсутствие способных моделей Fill-in-the-Middle (FIM), что автор оспаривает как неправильное перекладывание вины.
Metis: Связывание памяти текста и кода для самоэволюционных агентов
Metis вводит иерархическую двойную память, сочетающую память текста и память кода, чтобы улучшить самоэволюционные агенты. Она организует опыт в виде планов выполнения, фактов и ошибок, и кристаллизует повторно используемые планы в проверенные инструменты только при обосновании. На AppWorld Metis достигает на 20,6% большей точности выполнения задач и на 22,8% меньших затрат на выполнение по сравнению с ReAct, при лучшем общем балансе по точности, эффективности и затратам памяти.
NatureBench оценивает способность ИИ-агентов к кодированию к научным открытиям
NatureBench представляет бенчмарк из 90 задач, взятых из статей из журналов Nature, для оценки способности ИИ-агентов к достижению научных открытий. При протоколе, запрещающем использование веб-поиска, лучший модель превосходит предыдущие достижения только на 17,8% задач. Агенты в основном успешно решают задачи, переводя научные проблемы в задачи надзирания, а не через оригинальное научное изобретение.