Tras el lanzamiento de Deep Research por parte de OpenAI, un equipo reprodujo su marco agéntico en 24 horas y liberó la implementación a través de la biblioteca smolagents. El sistema resultante integra un LLM con herramientas para navegación web e inspección de texto para realizar tareas de razonamiento multi-paso.

  • La reproducción utiliza una arquitectura de "agente de código", permitiendo que el modelo exprese acciones como código en lugar de JSON, lo que reduce el uso de tokens y mejora la gestión del estado.
  • En el conjunto de validación GAIA, el sistema de código abierto logró 55.15%, superando el estado del arte previo de 46% mantenido por Magentic-One.
  • Este rendimiento excede significativamente la puntuación de ~7% de GPT-4 independiente en el mismo benchmark y se acerca al 67.36% reportado por OpenAI.
  • El equipo señala que la paridad completa con OpenAI requeriría capacidades de interacción con el navegador más avanzadas más allá de la implementación actual solo de texto.

Los autores consideran esto significativo porque demuestra que los marcos agénticos de código abierto pueden impulsar drásticamente el rendimiento de LLM en benchmarks complejos e intensivos en conocimiento sin depender de modelos propietarios.