OpenAI가 Deep Research를 출시한 후, 한 팀은 24시간 만에 그 에이전트 프레임워크를 재현하고 smolagents 라이브러리를 통해 구현을 오픈소스로 공개했습니다. 결과적으로该系统는 LLM과 웹 브라우징 및 텍스트 검사를 위한 도구를 통합하여 다단계 추론 작업을 수행합니다.

  • 이 재현은 "코드 에이전트" 아키텍처를 활용하며, 모델이 JSON 대신 코드로 행동을 표현할 수 있게 하여 토큰 사용량을 줄이고 상태 처리를 개선합니다.
  • GAIA 검증 세트에서 오픈소스 시스템은 55.15%의 점수를 달성하여 Magentic-One이 보유하고 있던 이전 최상위 성능인 46%를 능가했습니다.
  • 이 성능은 동일한 벤치마크에서 독립형 GPT-4의 약 7% 점수를 크게 상회하며, OpenAI가 보고한 67.36%에 근접합니다.
  • 팀은 현재 텍스트 전용 구현을 넘어선 더 발전된 브라우저 상호작용 기능이 필요할 때만 OpenAI와의 완전한 동등성을 달성할 수 있다고 언급했습니다.

저자들은 이것이 오픈소스 에이전트 프레임워크가 독점 모델에 의존하지 않고도 복잡한 지식 집약적 벤치마크에서 LLM 성능을 극적으로 향상시킬 수 있음을 보여주므로 중요하다고 평가합니다.