После выпуска Deep Research от OpenAI команда за 24 часа воспроизвела его агентную архитектуру и открыла исходный код реализации через библиотеку smolagents. Полученная система интегрирует LLM с инструментами для веб-просмотра и анализа текста, чтобы выполнять многошаговые задачи рассуждения.
- Воспроизведение использует архитектуру "code agent", позволяющую модели выражать действия как код, а не JSON, что снижает использование токенов и улучшает обработку состояния.
- На валидационном наборе GAIA открытая система достигла 55.15%, превзойдя предыдущий результат в 46%, принадлежавший Magentic-One.
- Этот показатель значительно превышает ~7% результата автономной GPT-4 на том же бенчмарке и приближается к заявленному OpenAI результату в 67.36%.
- Авторы отмечают, что полное соответствие с OpenAI потребовало бы более продвинутых возможностей взаимодействия с браузером, выходящих за рамки текущей реализации только с текстом.
Авторы считают это значимым, поскольку это демонстрирует, что открытые агентные фреймворки могут значительно повысить производительность LLM на сложных бенчмарках, требующих глубоких знаний, без использования проприетарных моделей.