Training data
media Hugging Face Forums · il y a 6 j

OpenGauntlet publie un catalogue de 168 systèmes TTS et 106 systèmes STT

Un chercheur a publié le catalogue de recherche OpenGauntlet, une ressource publique contenant des informations sur 168 systèmes de synthèse vocale (TTS) et 106 systèmes de reconnaissance vocale (STT). Les répertoires couvrent les modèles open source et hébergés, les licences, les exigences matérielles, les langues, les capacités, le statut du cycle de vie, les informations sources et les données de benchmark publiées lorsque disponibles.

media Hugging Face Forums · il y a 12 j · 2 vues

Calibra : boîte à outils open-source pour l'observabilité des ensembles de données robotiques

Calibra est une boîte à outils open-source conçue pour aider les chercheurs à auditer les ensembles de données robotiques et à identifier les problèmes de qualité avant d'entraîner des politiques. La première version publique inclut un Espace interactif Robot Dataset Health Check pour auditer les ensembles de données LeRobot et un benchmark de 30 ensembles de données publics LeRobot avec des scores de santé.

media Hugging Face Forums · il y a 23 j · 3 vues

louidev publie GlassBallAI, un ensemble de données verrouillé dans le temps sur les prévisions de Gemini pour étudier le comportement des LLM

louidev a publié l'ensemble de données GlassBallAI sur Hugging Face, capturant le comportement de prévision en direct des modèles Gemini de Google avant que les résultats ne soient connus. L'ensemble de données contient plus de 3 655 lignes de données collectées entre le 17 février et le 19 mai 2026, couvrant Gemini 2.5 Flash, 2.5 Pro, 2.5 Flash Lite et 3.0 Flash Preview.

media Hugging Face Forums · il y a 24 j

Discussion sur la gestion des goulots d'étranglement de données dans les simulations ML scientifiques

Un utilisateur partage son expérience concernant le coût computationnel de la génération de jeux de données d'entraînement à partir de simulations physiques, telles que l'écoulement fluide et les champs structurels. Il souligne que le défi principal n'est pas l'architecture du modèle, mais la difficulté de construire un jeu de données large et diversifié lorsque chaque échantillon est coûteux à produire.

arxiv arXiv cs.LG · il y a 24 j

CSFS réduit de 21 % le coût de sélection des caractéristiques pour la prédiction de l'énergie éolienne et solaire

Les chercheurs proposent Cluster-based Sequential Feature Selection (CSFS), une nouvelle méthode wrapper basée sur le clustering pour la sélection automatique et efficace des caractéristiques dans les pipelines de prédiction des énergies renouvelables. Cette approche répond au manque de méthodes systématiques pour sélectionner les caractéristiques d'entrée parmi le grand nombre de variables de surveillance et environnementales disponibles.

arxiv arXiv cs.AI · il y a 24 j

CSFS réduit le coût computationnel de 21 % dans la prédiction des énergies renouvelables

Les chercheurs proposent la Sélection Séquentielle de Caractéristiques basée sur des Clusters (CSFS), une nouvelle méthode wrapper indépendante du modèle conçue pour pallier l'absence de sélection systématique de caractéristiques dans la prédiction de la puissance éolienne et solaire. L'approche vise à fournir une sélection automatique, efficace et fiable de caractéristiques pour les pipelines d'énergies renouvelables.

arxiv arXiv cs.AI · il y a 24 j

FormalAnalyticGeo génère des problèmes de géométrie analytique multimodale via un pipeline neuro-symbolique

Les chercheurs présentent FormalAnalyticGeo, un framework évolutif pour la génération entièrement automatique de problèmes de géométrie analytique multimodale qui élimine le besoin d'annotation humaine. Le système utilise une représentation intermédiaire formelle appelée CDL pour relier le texte du problème au rendu précis du diagramme via un moteur de Champ de Distance Signé.

arxiv arXiv cs.CL · il y a 26 j · 1 vue

Les chercheurs publient le jeu de données ICSL pour la reconnaissance de la Langue des Signes Brésilienne en voiture

Un nouveau jeu de données multimodal appelé corpus In-Car Sign Language (ICSL) a été introduit pour relever les défis liés à l'utilisation de la langue des signes dans les services de mobilité partagée tels que les taxis et les plateformes de covoiturage. Cette ressource se concentre sur la Langue des Signes Brésilienne (Libras) afin d'améliorer l'accessibilité des transports publics pour la communauté sourde et malentendante à l'intérieur de véhicules confinés.

arxiv arXiv cs.CL · il y a 26 j

Une étude révèle une légère tendance négative dans la compositionnalité des composés allemands et anglais au fil du temps

Les chercheurs ont étudié le changement sémantique dans 23 composés nominaux allemands et 26 anglais en introduisant la tâche de prédiction de tendance de compositionnalité (Compositionality Trend Prediction), évaluée contre un nouvel ensemble de données de notes diachroniques par décennie. Contrairement à la littérature qui postule une tendance décisive des composés à devenir moins compositionnels, l'étude ne trouve qu'une petite tendance négative au fil du temps.

arxiv arXiv cs.CL · il y a 26 j

JobHop v2 : Ensemble de données à grande échelle de trajectoires professionnelles à partir de CV non structurés

Les chercheurs ont publié JobHop v2, une version améliorée de l'ensemble de données JobHop disponible publiquement, conçu pour la planification de la main-d'œuvre et l'analyse du marché du travail. Construit par extraction end-to-end à partir d'environ 440 000 CV multilingues pseudonymisés fournis par VDAB, le service public de l'emploi flamand, l'ensemble de données contient 355 315 trajectoires professionnelles.

arxiv arXiv cs.LG · il y a 26 j

Étude évalue les approches NLP pour l'extraction de mots-clés à partir de collections crowdsourcées

Un projet utilisant l'archive en ligne Their Finest Hour Online Archive de l'Université d'Oxford a évalué trois approches de traitement du langage naturel (NLP) — la reconnaissance d'entités nommées, l'extraction de mots-clés et la modélisation thématique — pour automatiser l'extraction de mots-clés à grande échelle. L'étude a testé ces méthodes sur une gamme de techniques, allant des modèles statistiques traditionnels aux réseaux neuronaux modernes d'IA générative.