Sujet · Training data
media Hugging Face Forums · il y a 12 j · 8 vues

OpenGauntlet publie un catalogue de 168 systèmes TTS et 106 systèmes STT

Un chercheur a publié le catalogue de recherche OpenGauntlet, une ressource publique contenant des informations sur 168 systèmes de synthèse vocale (TTS) et 106 systèmes de reconnaissance vocale (STT). Les répertoires couvrent les modèles open source et hébergés, les licences, les exigences matérielles, les langues, les capacités, le statut du cycle de vie, les informations sources et les données de benchmark publiées lorsque disponibles.

media Hugging Face Forums · il y a 17 j · 3 vues

Calibra : boîte à outils open-source pour l'observabilité des ensembles de données robotiques

Calibra est une boîte à outils open-source conçue pour aider les chercheurs à auditer les ensembles de données robotiques et à identifier les problèmes de qualité avant d'entraîner des politiques. La première version publique inclut un Espace interactif Robot Dataset Health Check pour auditer les ensembles de données LeRobot et un benchmark de 30 ensembles de données publics LeRobot avec des scores de santé.

media Hugging Face Forums · il y a 28 j · 4 vues

louidev publie GlassBallAI, un ensemble de données verrouillé dans le temps sur les prévisions de Gemini pour étudier le comportement des LLM

louidev a publié l'ensemble de données GlassBallAI sur Hugging Face, capturant le comportement de prévision en direct des modèles Gemini de Google avant que les résultats ne soient connus. L'ensemble de données contient plus de 3 655 lignes de données collectées entre le 17 février et le 19 mai 2026, couvrant Gemini 2.5 Flash, 2.5 Pro, 2.5 Flash Lite et 3.0 Flash Preview.

media Hugging Face Forums · il y a 30 j · 1 vue

Discussion sur la gestion des goulots d'étranglement de données dans les simulations ML scientifiques

Un utilisateur partage son expérience concernant le coût computationnel de la génération de jeux de données d'entraînement à partir de simulations physiques, telles que l'écoulement fluide et les champs structurels. Il souligne que le défi principal n'est pas l'architecture du modèle, mais la difficulté de construire un jeu de données large et diversifié lorsque chaque échantillon est coûteux à produire.