Após o lançamento do Deep Research pela OpenAI, uma equipe reproduziu seu framework agêntico em 24 horas e disponibilizou a implementação como código-fonte aberto por meio da biblioteca smolagents. O sistema resultante integra um LLM com ferramentas para navegação na web e inspeção de texto para realizar tarefas de raciocínio multi-etapas.

  • A reprodução utiliza uma arquitetura de "agente de código", permitindo que o modelo expresse ações como código em vez de JSON, o que reduz o uso de tokens e melhora o gerenciamento de estado.
  • No conjunto de validação do GAIA, o sistema de código-fonte aberto alcançou 55,15%, superando o estado da arte anterior de 46% detido pelo Magentic-One.
  • Esse desempenho excede significativamente a pontuação de ~7% do GPT-4 independente no mesmo benchmark e se aproxima dos 67,36% relatados pela OpenAI.
  • A equipe observa que a paridade total com a OpenAI exigiria capacidades mais avançadas de interação com o navegador além da implementação atual apenas para texto.

Os autores consideram isso significativo porque demonstra que frameworks agênticos de código-fonte aberto podem impulsionar dramaticamente o desempenho do LLM em benchmarks complexos e intensivos em conhecimento, sem depender de modelos proprietários.