Une étude évaluant les grands modèles de langage (LLM) pour la synthèse systématique de preuves sur l'oncogenèse microbienne a révélé que GPT-5 et GPT-5 Nano performent de manière indistinguable des experts du domaine. Les chercheurs ont évalué Gemini 2.5 Pro, Gemini 2.5 Flash, GPT-5 et GPT-5 Nano sur 24 articles de recherche en utilisant un modèle structuré de 77 éléments couvrant plusieurs types de questions.

  • Les réponses des LLM étaient étroitement alignées avec celles des experts pour tous les types de questions, y compris QCM, échelle de Likert, sélection multiple et formats libres.
  • GPT-5 et GPT-5 Nano ont obtenu des distributions de scores statistiquement indistinguables de celles des experts humains.
  • Les modèles Gemini se sont comportés de manière similaire mais ont été significativement plus permissifs dans l'application des critères d'oncogenèse microbienne.
  • Les hallucinations étaient rares, bien que l'évaluation méthodologique et l'identification des contradictions soient restées des vulnérabilités persistantes pour tous les modèles.

Les résultats soutiennent l'utilisation des LLM pour la synthèse systématique automatisée de preuves afin d'identifier les paires microbe-cancer, bien qu'un renforcement supplémentaire soit nécessaire pour les tâches d'analyse de texte intégral complexes.