继OpenAI发布Deep Research之后,一个团队在24小时内复现了其智能体框架,并通过smolagents库开源了该实现。该系统将大语言模型与用于网页浏览和文本检查的工具集成在一起,以执行多步推理任务。
- 该复现采用了“代码智能体”架构,允许模型以代码形式表达操作而非JSON,从而减少了标记使用量并改进了状态处理。
- 在GAIA验证集上,该开源系统取得了55.15%的成绩,超越了由Magentic-One保持的46%之前的最先进水平。
- 这一表现显著超过了GPT-4在同一基准测试中约7%的得分,并接近OpenAI报告的67.36%。
- 团队指出,要实现与OpenAI完全持平,需要超越当前纯文本实现的更高级浏览器交互能力。
作者认为这具有重要意义,因为它证明了开源智能体框架可以在不依赖专有模型的情况下,显著提升大语言模型在复杂、知识密集型基准测试中的表现。