Sujet · Evaluation & benchmarks
lab OpenAI News · il y a 7 j · 25 vues

OpenAI publie MentalHealthBench pour évaluer les réponses des IA en santé mentale

OpenAI a présenté MentalHealthBench, un benchmark ouvert conçu pour évaluer la manière dont les systèmes d'IA répondent dans des conversations réalistes sur la santé mentale. Développé avec plus de 80 experts en santé mentale agréés provenant de 22 pays, ce benchmark évalue les capacités des modèles sur des comportements clés tels que la sécurité, la recherche de contexte et le maintien de l'autonomie de l'utilisateur.

media Don't Worry About the Vase · il y a 22 j · 20 vues

Le modèle Astra d'OpenAI est plus difficile à surveiller à mesure que l'efficacité de la Chaîne de Pensée diminue

OpenAI reconnaît que son nouveau modèle Astra est significativement plus difficile à surveiller que les itérations précédentes, marquant un déclin dans l'efficacité de la surveillance de la Chaîne de Pensée (CoT). Cette tendance suggère qu'à mesure que les capacités du modèle augmentent, la capacité à détecter le désalignement par l'analyse CoT diminue, rendant potentiellement les systèmes de surveillance actuels peu fiables dans un an.

lab Hugging Face Blog · il y a 4 h

Lancement du classement Open TTS pour l'évaluation évolutive de la synthèse vocale multilingue

Le classement Open TTS a été publié pour répondre à la fragmentation et au manque de standardisation dans l'évaluation de la synthèse vocale (TTS) en utilisant des métriques objectives plutôt que de se fier uniquement aux scores de préférence humaine basés sur des arènes, qui sont lents. Il évalue les modèles sur l'intelligibilité, la vitesse et la similarité du locuteur en utilisant les embeddings Qwen3 ASR et WavLM.

arxiv arXiv cs.CL · il y a 2 j · 1 vue

Une étude révèle une divergence des politiques épistémiques dans la contamination des LLM multi-tours

Une étude intitulée « Divergence des politiques épistémiques dans la contamination des LLM multi-tours : Une investigation par gradient de protocole » évalue comment les grands modèles de langage gèrent les prémisses fausses injectées dans l'historique de conversation, un mode d'échec appelé contamination au niveau de la session. Les chercheurs ont testé GPT-5.4 Mini, Gemini-3.1 Flash-Lite et GLM-4.5-Air sur dix domaines de connaissances en utilisant 22 500 tours à température nulle.

arxiv arXiv cs.CL · il y a 2 j · 1 vue

Rep2Act aligne les représentations des VLM pour améliorer l'abstention sur le nouveau benchmark VAD-R

Les chercheurs présentent Visual Answerability Diagnosis with Rationales (VAD-R), un nouveau benchmark conçu pour évaluer la capacité des modèles vision-langage à s'abstenir de répondre aux questions sans réponse, sans se fier à des indices de raccourci. L'étude révèle que si les états cachés peuvent distinguer l'accessibilité de la réponse, les modèles actuels échuent à traduire cela en décisions explicites.

media Hugging Face Forums · il y a 2 j · 1 vue

Ujjal Bhattacharjee propose un plan d'étude pour tester le débat structuré d'agents pour la révision des preuves

Ujjal Bhattacharjee a proposé un cadre méthodologique pour évaluer si le défi et la révision structurés améliorent une tâche de révision des preuves sous des contraintes fixes de budget et de délai. La proposition décrit une expérience à quatre conditions comparant des réviseurs uniques, l'agrégation indépendante, la délibération structurée et la délibération avec l'évaluateur Jev.

media Hugging Face Forums · il y a 3 j · 1 vue

SecFathy rejette le modèle spécialisé XSS de 8B en raison d'échecs adversariaux

Le développeur SecFathy a open-sourcé un prototype de recherche appelé XSS Specialist, un modèle de sécurité de 8B conçu pour l'analyse des vulnérabilités XSS. Le projet visait initialement à repousser les limites de la spécialisation en utilisant le retrieval et LoRA, mais a finalement rejeté le modèle car il a échoué aux tests adversariaux de near-miss où de petits changements d'identifiants ont provoqué des jugements de sécurité incorrects.

media Hugging Face Forums · il y a 3 j · 9 vues

Claude Opus 5 et Tetsu trouvent six vérifications CI creuses dans leur propre projet

Le 27 septembre, Claude Opus 5 et le modèle Tetsu de 3B ont identifié six vérifications d'intégration continue distinctes dans leur dépôt public qui indiquaient un statut vert ou réussi bien qu'elles ne vérifient pas ce qu'elles étaient censées mesurer. Les problèmes allaient d'un portail de déploiement refusant des redémarrages valides en raison de hachages obsolètes à des benchmarks de temporisation avec des seuils creux acceptant des différences de performance négligeables.

media Hugging Face Forums · il y a 4 j · 7 vues

Scepticisme de la communauté envers les affirmations d'efficacité et de nouveauté technique de Jev

L'article discute d'une vague d'intérêt pour "Jev" sur LinkedIn, où il a été présenté comme une percée révolutionnaire en IA, bien que l'auteur ait trouvé peu de preuves substantielles pour étayer ces affirmations. L'auteur note que, bien que Jev promeuve une efficacité massive et un nouveau paradigme, il manque de données d'évaluation et de détails techniques, soulevant des questions sur le fait qu'il représente une véritable innovation architecturale ou simplement une reclassification.

media Hugging Face Forums · il y a 7 j · 12 vues

Analyse de la surconfiance artificielle dans les systèmes d'IA entraînés par RLHF

Les grands modèles de langage modernes sont systématiquement surconfiants, exprimant une haute confiance dans des réponses incorrectes en raison d'incitations à l'entraînement plutôt que de défaillances techniques de calibration. Pendant l'apprentissage par renforcement avec feedback humain (RLHF), les évaluateurs humains récompensent les réponses qui sonnent autoritaires et définitives, amenant le modèle à apprendre que l'incertitude est pénalisée.

arxiv arXiv cs.CL · il y a 7 j · 2 vues

Le benchmark WebMRE révèle le renforcement mutuel guide-action dans les agents web

Les auteurs présentent WebMRE, un benchmark hors ligne de 541 tâches et 5 293 étapes dérivés de trajectoires WebArena réussies, conçu pour fournir un protocole déterministe d'évaluation des points de contrôle des agents web sans dérive de l'environnement. Ce cadre associe des phrases-guide orientées humain à des actions ancrées afin d'étudier l'effet de renforcement mutuel entre elles.

lab Hugging Face Blog · il y a 8 j · 25 vues

L'AISI publie des résultats d'évaluation vérifiés pour six modèles de pointe sur cinq benchmarks

L'Institut britannique pour la sécurité de l'IA (AISI) a rendu accessibles publiquement les méthodes d'évaluation et les conclusions via la plateforme Evaluation Cards d'EvalEval afin d'améliorer la reproductibilité des benchmarks. Cette publication inclut des résultats vérifiés, du contexte et des informations de configuration pour cinq benchmarks spécifiques : HealthBench, FrontierMath, Humanity's Last Exam, SWE-Bench Pro et Terminal-Bench 2.0.