Training data
media Hugging Face Forums · hace 6 d

OpenGauntlet publica un catálogo de 168 sistemas TTS y 106 sistemas STT

Un investigador ha publicado el catálogo de investigación OpenGauntlet, un recurso público que contiene información sobre 168 sistemas de texto a voz (TTS) y 106 sistemas de voz a texto (STT). Los directorios cubren modelos de código abierto y alojados, licencias, requisitos de hardware, idiomas, capacidades, estado del ciclo de vida, información de origen y datos de benchmark publicados cuando están disponibles.

media Hugging Face Forums · hace 12 d · 2 vistas

Calibra: kit de herramientas de código abierto para la observabilidad de conjuntos de datos de robots

Calibra es un kit de herramientas de código abierto diseñado para ayudar a los investigadores a auditar conjuntos de datos de robots e identificar problemas de calidad antes de entrenar políticas. El primer lanzamiento público incluye un Espacio interactivo Robot Dataset Health Check para auditar conjuntos de datos LeRobot y una evaluación comparativa de 30 conjuntos de datos públicos de LeRobot con puntuaciones de salud.

media Hugging Face Forums · hace 23 d · 3 vistas

louidev lanza GlassBallAI, un conjunto de datos con bloqueo temporal de pronósticos de Gemini para estudiar el comportamiento de los LLM

louidev ha publicado el conjunto de datos GlassBallAI en Hugging Face, capturando el comportamiento de pronóstico en vivo de los modelos Gemini de Google antes de que se conozcan los resultados. El conjunto de datos contiene más de 3.655 filas de datos recopilados entre el 17 de febrero y el 19 de mayo de 2026, cubriendo Gemini 2.5 Flash, 2.5 Pro, 2.5 Flash Lite y 3.0 Flash Preview.

lab IBM Research (Granite) · hace 23 d HumanEval · 83.5%

IBM abre el código fuente de CodeAlchemy, un conjunto de datos sintético masivo de código de alta calidad

IBM ha abierto el código fuente de CodeAlchemy, una canalización y un conjunto de datos sintéticos diseñados para mejorar el rendimiento de los modelos de IA al emparejar código con trazas de ejecución. El lanzamiento incluye casi 1 billón de tokens en 15 lenguajes de programación, sumando al menos 200 veces el tamaño de Wikipedia.

media Hugging Face Forums · hace 24 d

Discusión sobre el manejo de cuellos de botella de datos en simulaciones de ML científico

Un usuario comparte su experiencia con el costo computacional de generar conjuntos de datos de entrenamiento a partir de simulaciones físicas, como flujo de fluidos y campos estructurales. Destaca que el desafío principal no es la arquitectura del modelo, sino la dificultad de construir un conjunto de datos grande y diverso cuando cada muestra es costosa de producir.

arxiv arXiv cs.LG · hace 24 d

CSFS reduce el costo de selección de características para la predicción de energía eólica y solar en un 21%

Los investigadores proponen la Selección Secuencial de Características basada en Clústeres (CSFS), un nuevo método envolvente basado en clústeres para la selección automática y eficiente de características en pipelines de predicción de energías renovables. El enfoque aborda la falta de métodos sistemáticos para seleccionar características de entrada entre el gran número de variables de monitoreo y ambientales disponibles.

arxiv arXiv cs.AI · hace 24 d

CSFS reduce el costo computacional en un 21% en la predicción de energía renovable

Los investigadores proponen la Selección Secuencial de Características Basada en Clusters (CSFS), un nuevo método envoltorio agnóstico al modelo diseñado para abordar la falta de selección sistemática de características en la predicción de potencia eólica y solar. El enfoque tiene como objetivo proporcionar una selección automática, eficiente y confiable de características para los flujos de trabajo de energía renovable.

arxiv arXiv cs.AI · hace 24 d · 1 vista

ViHoRec: Un conjunto de datos controlado para la recomendación de hoteles en Vietnam y una prueba de referencia para el arranque en frío

Los investigadores presentan ViHoRec, un conjunto de datos público de 18.267 interacciones entre 6.832 usuarios y 560 hoteles para la recomendación de hoteles en Vietnam. El recurso aborda desafíos en la resolución de entidades entre plataformas y la liberación que preserva la privacidad mediante pseudónimos HMAC.

arxiv arXiv cs.AI · hace 24 d

FormalAnalyticGeo genera problemas de geometría analítica multimodal mediante un pipeline neural-simbólico

Los investigadores presentan FormalAnalyticGeo, un marco escalable para la generación completamente automática de problemas de geometría analítica multimodal que elimina la necesidad de anotación humana. El sistema utiliza una representación intermedia formal llamada CDL para conectar el texto del problema con la renderización precisa de diagramas a través de un motor de Campo de Distancia Firmada.

arxiv arXiv cs.CL · hace 26 d · 1 vista

Investigadores lanzan el conjunto de datos ICSL para el reconocimiento de la Lengua de Señas Brasileña en vehículos

Se ha presentado un nuevo conjunto de datos multimodal llamado corpus In-Car Sign Language (ICSL) para abordar los desafíos del uso de la lengua de señas en servicios de movilidad compartida como taxis y plataformas de transporte por aplicación. El recurso se centra en la Lengua de Señas Brasileña (Libras) para mejorar la accesibilidad del transporte público para la comunidad sorda y con discapacidad auditiva en el interior confinado de los vehículos.

arxiv arXiv cs.CL · hace 26 d

El estudio encuentra una pequeña tendencia negativa en la composicionalidad de las compuestas alemanas e inglesas a lo largo del tiempo

Los investigadores investigan el cambio semántico en 23 compuestos nominales alemanes y 26 ingleses introduciendo la tarea de Predicción de Tendencia de Composicionalidad, evaluada contra un nuevo conjunto de datos de calificaciones diacrónicas por década. Contrario a la literatura que postula una tendencia decisiva hacia que las compuestas se vuelvan menos composicionales, el estudio encuentra solo una pequeña tendencia negativa con el tiempo.

arxiv arXiv cs.CL · hace 26 d

JobHop v2: Conjunto de datos a gran escala de trayectorias profesionales a partir de currículums no estructurados

Los investigadores han lanzado JobHop v2, una versión mejorada del conjunto de datos JobHop disponible públicamente diseñado para la planificación de la fuerza laboral y el análisis del mercado laboral. Construido mediante extracción con modelos de lenguaje grandes de extremo a extremo a partir de aproximadamente 440 000 currículums multilingües pseudonimizados proporcionados por VDAB, el Servicio Público de Empleo flamenco, el conjunto de datos contiene 355 315 trayectorias profesionales.

arxiv arXiv cs.LG · hace 26 d

Estudio evalúa enfoques de PLN para extraer palabras clave de colecciones crowdsourced

Un proyecto que utiliza el Archivo Online Their Finest Hour de la Universidad de Oxford evaluó tres enfoques de Procesamiento del Lenguaje Natural (PLN) — Reconocimiento de Entidades Nombradas, Extracción de Palabras Clave y Modelado Temático — para automatizar la extracción de palabras clave a escala. El estudio probó estos métodos en un rango de técnicas, desde modelos estadísticos tradicionales hasta redes neuronales modernas de IA generativa.