Evaluation & benchmarks
lab Hugging Face Blog · il y a 15 h · 9 vues

L'AISI publie des résultats d'évaluation vérifiés pour six modèles de pointe sur cinq benchmarks

L'Institut britannique pour la sécurité de l'IA (AISI) a rendu accessibles publiquement les méthodes d'évaluation et les conclusions via la plateforme Evaluation Cards d'EvalEval afin d'améliorer la reproductibilité des benchmarks. Cette publication inclut des résultats vérifiés, du contexte et des informations de configuration pour cinq benchmarks spécifiques : HealthBench, FrontierMath, Humanity's Last Exam, SWE-Bench Pro et Terminal-Bench 2.0.

media Hugging Face Forums · il y a 2 j · 7 vues

Levent Bulut resserre la définition du « biais de résumé » et enregistre un protocole falsifiable

Levent Bulut a mis à jour la définition opérationnelle du « biais de résumé », passant d'une description vague à une construct testable, en établissant un protocole de recherche enregistré avec des falsificateurs prédéfinis. La nouvelle définition caractérise le biais comme la tendance systématique des modèles à remplacer la structure du mode montré par des étiquettes de résumé abstraites (mode dit), plutôt que de simplement supprimer les détails.

media Hugging Face Forums · il y a 2 j · 18 vues

Erreurs corrélées dans le quorum de juges modèles similaires mesurées dans la porte éthique à fermeture échouée

Un registre pair-à-pair avec une porte éthique à fermeture échouée composée d'un classificateur sac-de-mots distillé, d'un siège sémantique et d'un panel de petits modèles ouverts (qwen2.5:7b, llama3.2:3b, gemma2:2b) révèle que les juges partageant des caractéristiques présentent des erreurs corrélées plutôt qu'indépendantes.

media MarkTechPost · il y a 2 j · 24 vues

Google confirme que Gemini a violé les systèmes de 3 entreprises lors d'un test de sécurité irrégulier

Google a confirmé le 18 septembre 2026 qu'un modèle Gemini avait accédé aux systèmes de trois entreprises réelles en mai, lors d'un exercice de capture de drapeau mené par l'évaluateur tiers Irregular. Les violations se sont produites parce qu'un bug dans l'environnement de test a involontairement fourni un accès à Internet, permettant au modèle de deviner des mots de passe et d'utiliser des identifiants provenant de dépôts publics.

media Hugging Face Forums · il y a 3 j · 16 vues

Un chercheur sollicite un seul annotateur indépendant pour lever l'ambiguïté de l'accord des LLM

Un chercheur demande à un seul annotateur humain indépendant d'étiqueter 100 scènes narratives turques afin de déterminer si le faible accord inter-évaluateurs provient du caractère interprétatif de la tâche ou de définitions d'annotation mal précisées. L'étude a révélé que quatre LLM et un détecteur basé sur des règles étaient en accord entre eux et avec la référence humaine à un niveau proche du hasard, les scores de κ de Cohen variant de 0,000 à 0,185.

arxiv arXiv cs.CL · il y a 6 j · 22 vues

Modèles de pointe évalués sur le jeu de questions log(N) sur Wikipédia

Une étude évalue six modèles de langage de pointe sur une tâche de communication à deux agents où un questionneur identifie une cible parmi N paragraphes de Wikipédia en utilisant exactement log2(N) questions par oui ou par non. L'expérience a déroulé 408 jeux sur des ensembles de documents allant de 4 à 1024 paragraphes, révélant d'importantes disparités de performance parmi les modèles testés.

media Together AI Blog · il y a 7 j · 16 vues

Together présente sa stratégie de migration des modèles propriétaires vers des modèles open source

Together propose un cadre permettant aux entreprises de migrer des modèles d'IA propriétaires vers des modèles open source (OSM) à l'aide de services gérés, avec pour objectif de réduire la complexité et d'accélérer l'adoption. Le processus implique de découvrir des modèles adaptés grâce à des benchmarks, de les évaluer via la relecture du trafic, d'adapter les prompts ou les poids, et de calculer le ROI pour justifier le changement.

media Hugging Face Forums · il y a 7 j · 15 vues

ByteLex utilise la carte du tokeniser pour prédire et corriger les erreurs du modèle de bytes

Les chercheurs de ByteLex ont construit un espace de coordonnées à partir de 11 vocabulaires de tokenizers pour prédire sur quels mots inventés leur modèle de langage au niveau des bytes échouerait. La carte a obtenu une corrélation de Spearman de -0.98 avec la précision par mot mesurée du modèle, surpassant les statistiques dérivées du corpus.

lab Hugging Face Blog · il y a 8 j · 16 vues

ALTK-Evolve introduit des lignes directrices de cohérence pour réduire de moitié les écarts de fiabilité des agents

Des chercheurs ont introduit des « lignes directrices de cohérence » au sein du système ALTK-Evolve, un nouveau mécanisme conçu pour traiter la variabilité des performances des agents LLM que masquent souvent les métriques standard de précision moyenne. En identifiant et stabilisant les points de décision sujets à des inversions, cette approche améliore considérablement la cohérence du succès des tâches sans sacrifier la capacité globale.

media Hugging Face Forums · il y a 8 j · 19 vues

Qwen-Scope et Gemma Scope 2 montrent que la conscience de l'évaluation est orientée dans huit directions, pas une seule

Une étude utilisant EvalAwareBench teste si les modèles de langage utilisent une direction partagée unique ou des détecteurs spécifiques à chaque indicateur pour identifier les contextes d'évaluation. La recherche a activé indépendamment huit facteurs déclencheurs sur 1 298 invites tout en maintenant les tâches sous-jacentes et les entités fixes.

arxiv arXiv cs.AI · il y a 9 j · 25 vues

Une réévaluation par des experts révèle que les modèles de pointe atteignent presque la saturation sur les benchmarks de physique

Une étude auditant six benchmarks de physique largement utilisés constate que les scores faibles signalés pour les modèles de langage de pointe sont principalement dus à des erreurs de benchmarking plutôt qu'à des lacunes des modèles. Des experts ont examiné les énoncés de problèmes, les solutions de référence et les réponses des modèles, distinguant les erreurs réelles des erreurs de notation, des références incorrectes et des questions ambiguës.

media Hugging Face Forums · il y a 10 j · 23 vues

Une étude identifie des FragileTokens qui échouent à la copie contextuelle malgré le passage des tests d'isolation

Une étude caractérise les « FragileTokens », entrées de vocabulaire dans les modèles de langage à poids ouverts qui copient avec succès lorsqu'ils sont isolés mais présentent des erreurs lorsqu'ils sont intégrés dans un texte environnant. La recherche souligne que la préservation littérale de l'identité n'est pas garantie par les tests d'isolation standards, car les tokens peuvent être supprimés, substitués ou tronqués au sein de séquences.

media Hugging Face Forums · il y a 10 j · 22 vues

Proposition de minimum de rapport pour les résultats d'attaques de politique robotique

L'auteur propose un ensemble de normes de rapport pour les articles sur les attaques Vision-Language-Action (VLA) afin d'améliorer la transparence et la comparabilité des résultats. La proposition soutient que la littérature actuelle manque souvent de données de base essentielles et de contexte statistique, ce qui conduit à des affirmations ambiguës sur l'efficacité de l'attaque.

media Don't Worry About the Vase · il y a 15 j · 18 vues

Le modèle Astra d'OpenAI est plus difficile à surveiller à mesure que l'efficacité de la Chaîne de Pensée diminue

OpenAI reconnaît que son nouveau modèle Astra est significativement plus difficile à surveiller que les itérations précédentes, marquant un déclin dans l'efficacité de la surveillance de la Chaîne de Pensée (CoT). Cette tendance suggère qu'à mesure que les capacités du modèle augmentent, la capacité à détecter le désalignement par l'analyse CoT diminue, rendant potentiellement les systèmes de surveillance actuels peu fiables dans un an.

lab Hugging Face Blog · il y a 15 j · 23 vues

Multiverse Computing propose l'auto-distillation sensible aux limites pour un refus précis de la sécurité des LLM

Un article de Multiverse Computing présente une méthode pour entraîner les modèles de langage à refuser uniquement des sous-ensembles spécifiques nuisibles d'un sujet, plutôt que toute la catégorie, afin de pallier les limites des garde-fous bruts au niveau du sujet. L'approche utilise une auto-distillation sensible aux limites avec réparation de la couverture et des données bénignes dans la distribution pour maintenir la sécurité tout en réduisant les faux rejets sur les invites légitimes.