Les chercheurs présentent GPQA, un ensemble de données difficile composé de 448 questions à choix multiples rédigées par des experts en biologie, physique et chimie. Le benchmark est conçu pour être extrêmement difficile ; les experts de niveau doctorat atteignent seulement 65% de précision, tandis que les non-experts qualifiés atteignent 34% même avec un accès web illimité. Les systèmes d'IA de pointe sont également en difficulté, la ligne de base GPT-4 la plus forte n'atteignant que 39% de précision. Cette difficulté pour les humains et les modèles de pointe vise à permettre des expériences de supervision réalistes et évolutives pour surveiller les sorties de l'IA dans le développement des connaissances scientifiques.
GPQA : Un benchmark de Q&A de niveau universitaire, résistant à Google
Benchmarks
| Benchmark | Modèle | Score |
|---|---|---|
| GPQA Diamond | GPT-4 based baseline | 39% |
M$^3$R-Bench introduit un benchmark ancré dans les preuves pour la compréhension des métaphores multimodales
Les chercheurs présentent M$^3$R-Bench, un benchmark unifié contenant 1 000 instances image-texte avec des annotations vérifiées par des humains, conçu pour évaluer la compréhension des métaphores multimodales ancrées dans les preuves. Le benchmark fournit des annotations conjointes pour l'occurrence de la métaphore, le mappage Cible-Source, le sentiment et des explications étape par étape basées sur la Théorie de la Métaphore Conceptuelle.
Le framework Zing améliore l'intelligence sociale des LLM via le benchmark SoMBench et l'ancrage Actio
Le rapport présente Zing, un framework intégré conçu pour améliorer l'intelligence sociale des grands modèles de langage en mesurant, intériorisant et ancrant les capacités sociales. Les auteurs présentent SoMBench, un benchmark fondé sur la psychologie couvrant 17 dimensions secondaires et 3 481 instances vérifiées par des experts, qui révèle que les LLM actuels ont une marge de progression significative, aucun modèle n'atteignant des performances proches du plafond.
Le benchmark SRRM révèle que Qwen2.5-1.5B surpasse le 3B en mémoire de contexte long
Un chercheur sollicite un avis favorable d'arXiv cs.CL pour un article présentant la Simple Retrieval-Reconstruction Memory (SRRM), un benchmark léger conçu pour évaluer la mémoire de contexte long dans les Small Language Models.
Le réglage fin des LLM avec des traits améliore la notation des dissertations selon plusieurs grilles
Les chercheurs s'attaquent au défi de la notation automatisée des dissertations lorsque les éducateurs révisent ou introduisent de nouvelles grilles, un scénario connu sous le nom de généralisation inter-grilles. Ils proposent un cadre de réglage fin pour les grands modèles de langage qui utilise des représentations intermédiaires indépendantes de la grille, appelées « traits », conjointement à la supervision par les dissertations cibles pendant l'entraînement.
Suivi en direct de la Gurbani : Benchmark et système de référence pour la sous-titration du Kirtan sikh
Les auteurs présentent un benchmark et un système de référence pour la sous-titration en direct du Kirtan sikh, qui implique la récitation chantée continue de versets du Sri Guru Granth Sahib Ji. Contrairement à la transcription à vocabulaire ouvert, cette tâche nécessite des correspondances mot pour mot exactes issues de l'écriture canonique pour éviter les fautes d'orthographe religieusement inappropriées.