Benchmark results
lab Hugging Face Blog · il y a 15 h · 9 vues

L'AISI publie des résultats d'évaluation vérifiés pour six modèles de pointe sur cinq benchmarks

L'Institut britannique pour la sécurité de l'IA (AISI) a rendu accessibles publiquement les méthodes d'évaluation et les conclusions via la plateforme Evaluation Cards d'EvalEval afin d'améliorer la reproductibilité des benchmarks. Cette publication inclut des résultats vérifiés, du contexte et des informations de configuration pour cinq benchmarks spécifiques : HealthBench, FrontierMath, Humanity's Last Exam, SWE-Bench Pro et Terminal-Bench 2.0.

media MarkTechPost · il y a 21 h GDPval-AA (Elo) · 1695.0Elo · 13 vues

SpaceXAI publie Grok 4.7 avec un modèle de base plus grand et des benchmarks améliorés

SpaceXAI a publié Grok 4.7, un nouveau modèle phare pour le codage, les tâches agentices et le travail sur les connaissances, qui utilise un modèle de base plus grand et une exécution d'apprentissage par renforcement prolongée par rapport à Grok 4.6. Le modèle maintient la même structure tarifaire que son prédécesseur tout en offrant des capacités améliorées en auto-vérification, gestion du contexte long et sécurité.

media Interconnects · il y a 2 j Artificial Analysis Intelligence Index · 45.0% · 17 vues

Les modèles chinois à poids ouverts surpassent leurs homologues américains en téléchargements et benchmarks

L'auteur présente un point sur l'état des modèles à poids ouverts, notant que les entreprises chinoises d'IA sont devenues les leaders clairs dans ce domaine depuis environ avril 2025. Ce changement est démontré par les métriques de téléchargement de Hugging Face et la performance sur les benchmarks de capacité.

media Hugging Face Forums · il y a 6 j · 13 vues

L'indice de gaspillage des agents évalue 341 054 exécutions publiques d'agents de codage pour détecter des schémas de gaspillage

L'indice de gaspillage des agents a évalué 341 054 trajectoires d'agents issues de 11 ensembles de données publics afin d'identifier les inefficacités telles que les boucles, les tentatives aveugles, les sorties d'outils surdimensionnées et les exécutions abandonnées. L'analyse révèle que les comportements de boucle et de réessai sont courants dans les modèles plus faibles comme les agents Llama, mais rares dans Claude 3.7 Sonnet et Qwen3-Coder-480B.

media r/LocalLLaMA · il y a 7 j · 18 vues

Le rapport de Mozilla affirme que les modèles d'IA à poids ouvert de la Chine sont en retard de 4 mois par rapport aux offres frontalières des États-Unis

Un rapport de Mozilla indique que les modèles d'IA à poids ouvert de la Chine ont réduit l'écart de développement à seulement quatre mois par rapport aux offres frontalières des États-Unis. Malgré cette progression rapide, les modèles continuent de prendre du retard dans certaines évaluations de benchmarks.

media MarkTechPost · il y a 7 j LMSYS Arena (Elo) · 1866.0Elo · 20 vues

Prior Labs publie TabPFN-3.5, battant le gagnant de Kaggle Otto 2015 avec les paramètres par défaut

Prior Labs a publié TabPFN-3.5, un modèle fondamental tabulaire qui prédit sur une table en un seul passage avant sans entraînement ni ajustement par jeu de données. Le modèle obtient un score de 0,375 sur le classement privé du Défi de Classification de Produits Otto Group 2015, battant le score gagnant original de 0,382 réalisé par Gilberto Titericz et Stanislav Semenov.

media MarkTechPost · il y a 7 j · 28 vues

Nums AI publie Causilo, un modèle fondamental tabulaire en tête du classement TabArena parmi les modèles uniques

Nums AI a publié Causilo, un modèle fondamental tabulaire pré-entraîné pour la classification et la régression, qui obtient le score Elo le plus élevé parmi les modèles uniques sur TabArena. Le modèle utilise une approche d'apprentissage in-context où les lignes d'entraînement sont stockées comme contexte plutôt que de mettre à jour les poids, et il est disponible avec du code sous licence Apache-2.0 et des poids pré-entraînés sur Hugging Face.

arxiv arXiv cs.CL · il y a 8 j Codeforces (Elo) · 98.2% · 27 vues

Stellar Colosseum exploite l'inférence multi-agents pour la recherche mathématique à long terme

Stellar Colosseum est un framework agnostique aux modèles conçu pour répartir l'inférence sur des recherches à long terme en mathématiques et en informatique théorique, afin de pallier l'instabilité des modèles de langage face à des problèmes complexes. Le système explore des stratégies alternatives avant la construction de la preuve, utilise une porte de préparation pour déterminer quand une voie est suffisamment mature pour être décomposée, et représente le plan de preuve comme un ensemble de sous-problèmes interdépendants au niveau des sections.

arxiv arXiv cs.LG · il y a 8 j Codeforces (Elo) · 98.2% · 25 vues

Stellar Colosseum : un harnais multi-agents pour la recherche en mathématiques et en informatique théorique sur le long terme

Les auteurs présentent Stellar Colosseum, un harnais agnostique aux modèles conçu pour répartir l'inférence dans la recherche à long terme en mathématiques et en informatique théorique. Le système explore des stratégies alternatives avant la construction de la preuve, utilise une porte d'état prêt pour déterminer quand une voie est suffisamment mature pour la décomposition, et représente le plan de preuve comme un ensemble de sous-problèmes interdépendants au niveau des sections.

arxiv arXiv cs.AI · il y a 9 j · 25 vues

Une réévaluation par des experts révèle que les modèles de pointe atteignent presque la saturation sur les benchmarks de physique

Une étude auditant six benchmarks de physique largement utilisés constate que les scores faibles signalés pour les modèles de langage de pointe sont principalement dus à des erreurs de benchmarking plutôt qu'à des lacunes des modèles. Des experts ont examiné les énoncés de problèmes, les solutions de référence et les réponses des modèles, distinguant les erreurs réelles des erreurs de notation, des références incorrectes et des questions ambiguës.

media MarkTechPost · il y a 10 j Terminal-Bench 2 · 92.8% · 28 vues

Cognition publie SWE-2, un modèle de codage post-entraîné Kimi K3 avec effort de raisonnement sélectionnable

Cognition a publié SWE-2, son modèle de codage le plus performant à ce jour, qui a été post-entraîné par apprentissage par renforcement à partir du modèle ouvert Kimi K3 de Moonshot AI, comptant 2,8 billions de paramètres. Le modèle obtient un score de 50,0 % sur FrontierCode 1.1 Main, le plaçant à un point de Fable 5.1 tout en fonctionnant avec des coûts réduits de 64 %.

lab NVIDIA Research · il y a 11 j · 16 vues

ReasoningBomb provoque un raisonnement pathologiquement long dans les grands modèles de raisonnement

Des chercheurs ont formalisé des attaques par déni de service au moment de l'inférence (PI-DoS) qui exploitent le coût computationnel élevé du raisonnement explicite multi-étapes dans les Grands Modèles de Raisonnement (LRMs). Ils présentent ReasoningBomb, un cadre basé sur l'apprentissage par renforcement qui entraîne un attaquant à générer des invites naturelles courtes qui poussent les modèles victimes vers des traces de raisonnement pathologiquement longues et souvent non terminantes.