Les chercheurs présentent GPQA, un ensemble de données difficile composé de 448 questions à choix multiples rédigées par des experts en biologie, physique et chimie. Le benchmark est conçu pour être extrêmement difficile ; les experts de niveau doctorat atteignent seulement 65% de précision, tandis que les non-experts qualifiés atteignent 34% même avec un accès web illimité. Les systèmes d'IA de pointe sont également en difficulté, la ligne de base GPT-4 la plus forte n'atteignant que 39% de précision. Cette difficulté pour les humains et les modèles de pointe vise à permettre des expériences de supervision réalistes et évolutives pour surveiller les sorties de l'IA dans le développement des connaissances scientifiques.
GPQA : Un benchmark de Q&A de niveau universitaire, résistant à Google
Benchmarks
| Benchmark | Modèle | Score |
|---|---|---|
| GPQA Diamond | GPT-4 based baseline | 39% |
Un chercheur sollicite un seul annotateur indépendant pour lever l'ambiguïté de l'accord des LLM
Un chercheur demande à un seul annotateur humain indépendant d'étiqueter 100 scènes narratives turques afin de déterminer si le faible accord inter-évaluateurs provient du caractère interprétatif de la tâche ou de définitions d'annotation mal précisées. L'étude a révélé que quatre LLM et un détecteur basé sur des règles étaient en accord entre eux et avec la référence humaine à un niveau proche du hasard, les scores de κ de Cohen variant de 0,000 à 0,185.
Une étude identifie des FragileTokens qui échouent à la copie contextuelle malgré le passage des tests d'isolation
Une étude caractérise les « FragileTokens », entrées de vocabulaire dans les modèles de langage à poids ouverts qui copient avec succès lorsqu'ils sont isolés mais présentent des erreurs lorsqu'ils sont intégrés dans un texte environnant. La recherche souligne que la préservation littérale de l'identité n'est pas garantie par les tests d'isolation standards, car les tokens peuvent être supprimés, substitués ou tronqués au sein de séquences.
GPT-5 et GPT-5 Nano égalent les experts dans l'évaluation de la recherche sur l'oncogenèse microbienne
Une étude démontre que GPT-5 et GPT-5 Nano atteignent un niveau de performance expert pour extraire des preuves et évaluer de manière critique des publications de recherche sur l'oncogenèse microbienne. Les chercheurs ont comparé ces modèles à Gemini 2.5 Pro et Gemini 2.5 Flash face à des experts du domaine, en utilisant un jeu de données de 24 articles centrés sur le MMTV-LV et le cancer du sein.
GPT-5 et GPT-5 Nano égalent les experts dans l'extraction de preuves sur l'oncogenèse microbienne
Une étude évaluant les grands modèles de langage (LLM) pour la synthèse systématique de preuves sur l'oncogenèse microbienne a révélé que GPT-5 et GPT-5 Nano performent de manière indistinguable des experts du domaine. Les chercheurs ont évalué Gemini 2.5 Pro, Gemini 2.5 Flash, GPT-5 et GPT-5 Nano sur 24 articles de recherche en utilisant un modèle structuré de 77 éléments couvrant plusieurs types de questions.
M$^3$R-Bench introduit un benchmark ancré dans les preuves pour la compréhension des métaphores multimodales
Les chercheurs présentent M$^3$R-Bench, un benchmark unifié contenant 1 000 instances image-texte avec des annotations vérifiées par des humains, conçu pour évaluer la compréhension des métaphores multimodales ancrées dans les preuves. Le benchmark fournit des annotations conjointes pour l'occurrence de la métaphore, le mappage Cible-Source, le sentiment et des explications étape par étape basées sur la Théorie de la Métaphore Conceptuelle.