Tema · Training data
media Hugging Face Forums · há 12 d · 8 visualizações

OpenGauntlet publica catálogo com 168 sistemas TTS e 106 sistemas STT

Um pesquisador publicou o catálogo de pesquisa OpenGauntlet, um recurso público contendo informações sobre 168 sistemas de texto para fala (TTS) e 106 sistemas de fala para texto (STT). Os diretórios cobrem modelos de código aberto e hospedados, licenças, requisitos de hardware, idiomas, capacidades, status do ciclo de vida, informações de origem e dados de benchmark publicados quando disponíveis.

media Hugging Face Forums · há 17 d · 3 visualizações

Calibra: toolkit de código aberto para observabilidade de conjuntos de dados de robôs

O Calibra é um toolkit de código aberto projetado para ajudar pesquisadores a auditar conjuntos de dados de robôs e identificar problemas de qualidade antes de treinar políticas. O primeiro lançamento público inclui um Espaço interativo Robot Dataset Health Check para auditar conjuntos de dados LeRobot e uma avaliação comparativa de 30 conjuntos de dados públicos do LeRobot com pontuações de saúde.

media Hugging Face Forums · há 28 d · 4 visualizações

louidev lança o GlassBallAI, um conjunto de dados com bloqueio temporal de previsões do Gemini para estudar o comportamento de LLMs

louidev lançou o conjunto de dados GlassBallAI no Hugging Face, capturando o comportamento de previsão em tempo real dos modelos Gemini do Google antes que os resultados sejam conhecidos. O conjunto de dados contém mais de 3.655 linhas de dados coletadas entre 17 de fevereiro e 19 de maio de 2026, abrangendo Gemini 2.5 Flash, 2.5 Pro, 2.5 Flash Lite e 3.0 Flash Preview.

media Hugging Face Forums · há 30 d · 1 visualização

Discussão sobre o tratamento de gargalos de dados em simulações de ML científico

Um usuário compartilha sua experiência com o custo computacional de gerar conjuntos de dados de treinamento a partir de simulações físicas, como fluxo de fluidos e campos estruturais. Ele destaca que o desafio principal não é a arquitetura do modelo, mas a dificuldade de construir um conjunto de dados grande e diverso quando cada amostra é cara de produzir.