OpenAIによるDeep Researchの公開を受け、あるチームは24時間以内にそのエージェントフレームワークを再現し、smolagentsライブラリを通じて実装をオープンソースとして公開した。このシステムは、LLMとウェブブラウジングやテキスト検査のためのツールを統合し、多段階推論タスクを実行する。

  • この再現は「コードエージェント」アーキテクチャを利用しており、モデルがJSONではなくコードとしてアクションを表現できるため、トークン使用量を削減し、状態処理を改善している。
  • GAIA検証セットにおいて、このオープンソースシステムは55.15%を達成し、Magentic-Oneが持っていた以前の最先端スコアである46%を上回った。
  • このパフォーマンスは、同じベンチマークにおける単体のGPT-4の約7%というスコアを大幅に上回り、OpenAIが報告した67.36%に近づいている。
  • チームは、現在のテキストのみの実装を超えたより高度なブラウザ操作機能が必要であれば、OpenAIとの完全な同等性が達成されると指摘している。

著者たちは、これが重要であると考えている。なぜなら、これはオープンソースのエージェントフレームワークが、独自モデルに依存することなく、複雑で知識集約的なベンチマークにおいてLLMのパフォーマンスを劇的に向上させられることを示しているからである。