Training data
media Hugging Face Forums · há 6 d

OpenGauntlet publica catálogo com 168 sistemas TTS e 106 sistemas STT

Um pesquisador publicou o catálogo de pesquisa OpenGauntlet, um recurso público contendo informações sobre 168 sistemas de texto para fala (TTS) e 106 sistemas de fala para texto (STT). Os diretórios cobrem modelos de código aberto e hospedados, licenças, requisitos de hardware, idiomas, capacidades, status do ciclo de vida, informações de origem e dados de benchmark publicados quando disponíveis.

media Hugging Face Forums · há 12 d · 2 visualizações

Calibra: toolkit de código aberto para observabilidade de conjuntos de dados de robôs

O Calibra é um toolkit de código aberto projetado para ajudar pesquisadores a auditar conjuntos de dados de robôs e identificar problemas de qualidade antes de treinar políticas. O primeiro lançamento público inclui um Espaço interativo Robot Dataset Health Check para auditar conjuntos de dados LeRobot e uma avaliação comparativa de 30 conjuntos de dados públicos do LeRobot com pontuações de saúde.

media Hugging Face Forums · há 23 d · 3 visualizações

louidev lança o GlassBallAI, um conjunto de dados com bloqueio temporal de previsões do Gemini para estudar o comportamento de LLMs

louidev lançou o conjunto de dados GlassBallAI no Hugging Face, capturando o comportamento de previsão em tempo real dos modelos Gemini do Google antes que os resultados sejam conhecidos. O conjunto de dados contém mais de 3.655 linhas de dados coletadas entre 17 de fevereiro e 19 de maio de 2026, abrangendo Gemini 2.5 Flash, 2.5 Pro, 2.5 Flash Lite e 3.0 Flash Preview.

arxiv arXiv cs.LG · há 24 d

CSFS reduz em 21% o custo de seleção de características para previsão de energia eólica e solar

Pesquisadores propõem a Seleção Sequencial de Características baseada em Clusters (CSFS), um novo método wrapper baseado em clusters para seleção automática e eficiente de características em pipelines de previsão de energias renováveis. A abordagem aborda a falta de métodos sistemáticos para selecionar características de entrada entre o grande número de variáveis de monitoramento e ambientais disponíveis.

arxiv arXiv cs.AI · há 24 d

FormalAnalyticGeo gera problemas de geometria analítica multimodal via pipeline neural-simbólico

Pesquisadores introduzem o FormalAnalyticGeo, um framework escalável para a geração totalmente automática de problemas de geometria analítica multimodal que elimina a necessidade de anotação humana. O sistema utiliza uma representação intermediária formal chamada CDL para conectar o texto do problema à renderização precisa de diagramas por meio de um motor Signed Distance Field.

arxiv arXiv cs.CL · há 26 d · 1 visualização

Pesquisadores lançam o conjunto de dados ICSL para reconhecimento da Língua Brasileira de Sinais em veículos

Um novo conjunto de dados multimodal chamado corpus In-Car Sign Language (ICSL) foi introduzido para abordar os desafios do uso da língua de sinais em serviços de mobilidade compartilhada, como táxis e plataformas de transporte por aplicativo. O recurso foca na Língua Brasileira de Sinais (Libras) para melhorar a acessibilidade do transporte público para a comunidade surda e com deficiência auditiva no interior confinado dos veículos.

arxiv arXiv cs.CL · há 26 d

Estudo encontra pequena tendência negativa na composicionalidade de compostos alemães e ingleses ao longo do tempo

Pesquisadores investigam a mudança semântica em 23 compostos nominais alemães e 26 ingleses, introduzindo a tarefa de Previsão de Tendência de Composicionalidade, avaliada contra um novo conjunto de dados de classificações diacrônicas por década. Contrariando a literatura que postula uma tendência decisiva de os compostos se tornarem menos composicionais, o estudo encontra apenas uma pequena tendência negativa ao longo do tempo.

arxiv arXiv cs.CL · há 26 d

JobHop v2: Conjunto de dados em larga escala de trajetórias de carreira a partir de currículos não estruturados

Pesquisadores lançaram o JobHop v2, uma versão aprimorada do conjunto de dados JobHop disponível publicamente, projetado para planejamento da força de trabalho e análise do mercado de trabalho. Construído por meio de extração ponta a ponta com grandes modelos de linguagem a partir de aproximadamente 440.000 currículos multilíngues pseudonimizados fornecidos pelo VDAB, o Serviço Público de Emprego flamengo, o conjunto de dados contém 355.315 trajetórias de carreira.

arxiv arXiv cs.LG · há 26 d

Estudo avalia abordagens de PLN para extrair palavras-chave de coleções crowdsourced

Um projeto que utiliza o Arquivo Online Their Finest Hour da Universidade de Oxford avaliou três abordagens de Processamento de Linguagem Natural (PLN) — Reconhecimento de Entidades Nomeadas, Extração de Palavras-Chave e Modelagem de Tópicos — para automatizar a extração de palavras-chave em escala. O estudo testou esses métodos em uma variedade de técnicas, desde modelos estatísticos tradicionais até redes neurais modernas de IA generativa.