Une étude démontre que GPT-5 et GPT-5 Nano atteignent un niveau de performance expert pour extraire des preuves et évaluer de manière critique des publications de recherche sur l'oncogenèse microbienne. Les chercheurs ont comparé ces modèles à Gemini 2.5 Pro et Gemini 2.5 Flash face à des experts du domaine, en utilisant un jeu de données de 24 articles centrés sur le MMTV-LV et le cancer du sein.

  • L'évaluation a utilisé un modèle structuré avec 77 éléments couvrant plusieurs types de questions, y compris des QCM, des échelles de Likert et des réponses en texte libre.
  • GPT-5 et GPT-5 Nano ont produit des distributions de scores indiscernables de celles des experts humains, tandis que les modèles Gemini étaient significativement plus indulgents dans l'application des critères.
  • Les hallucinations étaient rares pour tous les modèles, mais l'évaluation méthodologique et l'identification des contradictions au sein des textes complets sont restées des vulnérabilités persistantes.

Les résultats soutiennent l'utilisation des LLM pour la synthèse automatisée de preuves systématiques, bien que des renforcements supplémentaires soient nécessaires pour les tâches méthodologiques complexes.