Suite à la publication par OpenAI de Deep Research, une équipe a reproduit son cadre agentic en 24 heures et a ouvert le code source de l'implémentation via la bibliothèque smolagents. Le système résultant intègre un LLM avec des outils pour la navigation web et l'inspection de texte afin d'exécuter des tâches de raisonnement multi-étapes.

  • La reproduction utilise une architecture « agent de code », permettant au modèle d'exprimer les actions sous forme de code plutôt que de JSON, ce qui réduit l'utilisation de tokens et améliore la gestion de l'état.
  • Sur l'ensemble de validation GAIA, le système open-source a atteint 55,15 %, surpassant l'état de l'art précédent de 46 % détenu par Magentic-One.
  • Cette performance dépasse significativement le score d'environ 7 % de GPT-4 autonome sur le même benchmark et s'approche des 67,36 % rapportés par OpenAI.
  • L'équipe note qu'une parité complète avec OpenAI nécessiterait des capacités d'interaction navigateur plus avancées au-delà de l'implémentation actuelle uniquement textuelle.

Les auteurs considèrent cela comme significatif car cela démontre que les cadres agentic open-source peuvent améliorer considérablement les performances des LLM sur des benchmarks complexes et intensifs en connaissances, sans dépendre de modèles propriétaires.