주제 · Training data
media Hugging Face Forums · 7시간 전 · 조회수 1회

helloadhavan, Common Crawl에서 구조화된 Markdown 추출을 위한 CC-FilteredCorpus 출시

사용자 helloadhavan은 Common Crawl을 필터링하고 콘텐츠를 깔끔한 Markdown으로 추출하도록 설계된 CC-FilteredCorpus라는 데이터셋을 만들었습니다. 이 프로젝트는 모든 것을 평평한 텍스트로 만드는 대신 제목, 목록, 링크, 코드 블록 및 테이블을 포함한 유용한 문서 구조를 보존하는 것을 목표로 합니다.

media Hugging Face Forums · 12일 전 · 조회수 8회

OpenGauntlet이 168개 TTS 및 106개 STT 시스템의 카탈로그 게시

한 연구자가 OpenGauntlet 연구 카탈로그를 게시했습니다. 이는 168개의 텍스트 음성 변환(TTS) 시스템과 106개의 음성 텍스트 변환(STT) 시스템에 대한 정보를 포함하는 공개 리소스입니다. 디렉토리에는 오픈 및 호스팅 모델, 라이선스, 하드웨어 요구 사항, 언어, 기능, 수명 주기 상태, 소스 정보 및 사용 가능한 경우 게시된 벤치마크 데이터가 포함되어 있습니다.

media Hugging Face Forums · 17일 전 · 조회수 3회

Calibra: 로봇 데이터셋 관측성을 위한 오픈소스 툴킷

Calibra는 연구자가 정책을 훈련하기 전에 로봇 데이터셋을 감사하고 품질 문제를 식별할 수 있도록 설계된 오픈소스 툴킷입니다. 첫 번째 공개 릴리스에는 LeRobot 데이터셋을 감사하기 위한 상호작용형 Space인 Robot Dataset Health Check와 건강 점수가 포함된 30개의 공개 LeRobot 데이터셋 벤치마크가 포함되어 있습니다.

media Hugging Face Forums · 28일 전 · 조회수 4회

louidev가 LLM 동작 연구용 Gemini 예측 시점 잠금 데이터셋 GlassBallAI 공개

louidev가 Hugging Face에 GlassBallAI 데이터셋을 공개했으며, 이는 결과 판명이 되기 전 Google의 Gemini 모델들이 보인 실시간 예측 행동을 포착한 것이다. 이 데이터셋은 2026년 2월 17일부터 5월 19일까지 수집된 3,655개 이상의 행(row)으로 구성되어 있으며, Gemini 2.5 Flash, 2.5 Pro, 2.5 Flash Lite, 3.0 Flash Preview를 포함한다.

media Hugging Face Forums · 30일 전 · 조회수 1회

과학적 ML 시뮬레이션의 데이터 병목 현상 처리에 대한 논의

한 사용자가 유체 흐름 및 구조장과 같은 물리 시뮬레이션에서 훈련 데이터셋을 생성하는 데 따른 계산 비용 경험을 공유했습니다. 그들은 주요 과제가 모델 아키텍처가 아니라 각 샘플의 생산 비용이 높을 때 대규모이고 다양한 데이터셋을 구축하는 어려움이라고 강조했습니다.