Training data
media Hugging Face Forums · 6일 전

OpenGauntlet이 168개 TTS 및 106개 STT 시스템의 카탈로그 게시

한 연구자가 OpenGauntlet 연구 카탈로그를 게시했습니다. 이는 168개의 텍스트 음성 변환(TTS) 시스템과 106개의 음성 텍스트 변환(STT) 시스템에 대한 정보를 포함하는 공개 리소스입니다. 디렉토리에는 오픈 및 호스팅 모델, 라이선스, 하드웨어 요구 사항, 언어, 기능, 수명 주기 상태, 소스 정보 및 사용 가능한 경우 게시된 벤치마크 데이터가 포함되어 있습니다.

media Hugging Face Forums · 12일 전 · 조회수 2회

Calibra: 로봇 데이터셋 관측성을 위한 오픈소스 툴킷

Calibra는 연구자가 정책을 훈련하기 전에 로봇 데이터셋을 감사하고 품질 문제를 식별할 수 있도록 설계된 오픈소스 툴킷입니다. 첫 번째 공개 릴리스에는 LeRobot 데이터셋을 감사하기 위한 상호작용형 Space인 Robot Dataset Health Check와 건강 점수가 포함된 30개의 공개 LeRobot 데이터셋 벤치마크가 포함되어 있습니다.

media Hugging Face Forums · 23일 전 · 조회수 3회

louidev가 LLM 동작 연구용 Gemini 예측 시점 잠금 데이터셋 GlassBallAI 공개

louidev가 Hugging Face에 GlassBallAI 데이터셋을 공개했으며, 이는 결과 판명이 되기 전 Google의 Gemini 모델들이 보인 실시간 예측 행동을 포착한 것이다. 이 데이터셋은 2026년 2월 17일부터 5월 19일까지 수집된 3,655개 이상의 행(row)으로 구성되어 있으며, Gemini 2.5 Flash, 2.5 Pro, 2.5 Flash Lite, 3.0 Flash Preview를 포함한다.

lab IBM Research (Granite) · 23일 전 HumanEval · 83.5%

IBM이 고품질 코드의 방대한 합성 데이터셋인 CodeAlchemy를 오픈소스로 공개

IBM은 코드와 실행 트레이스를 페어링하여 AI 모델 성능을 향상시키기 위해 설계된 파이프라인 및 합성 데이터셋인 CodeAlchemy를 오픈소스로 공개했습니다. 이번 릴리스에는 15개 프로그래밍 언어에 걸쳐 거의 1조 개의 토큰이 포함되어 있으며, 이는 위키백과 크기의 최소 200배에 해당합니다.

arxiv arXiv cs.LG · 24일 전

CSFS, 풍력 및 태양광 발전 예측 특징 선택 비용 21% 절감

연구자들은 재생 에너지 예측 파이프라인에서 자동적이고 효율적인 특징 선택을 위한 새로운 클러스터링 기반 래퍼 방법인 Cluster-based Sequential Feature Selection (CSFS)를 제안합니다. 이 접근법은 사용 가능한 모니터링 및 환경 변수가 많은 상태에서 입력 특징을 선택하기 위한 체계적인 방법의 부재를 해결합니다.

arxiv arXiv cs.AI · 24일 전

FormalAnalyticGeo는 신경-기호 파이프라인을 통해 다중 모달 해석 기하학 문제를 생성합니다

연구자들은 인간의 주석이 필요 없는 다중 모달 해석 기하학 문제의 완전 자동 생성을 위한 확장 가능한 프레임워크인 FormalAnalyticGeo를 소개했습니다. 이 시스템은 부호 있는 거리장 엔진을 통해 문제 텍스트와 정확한 다이어그램 렌더링을 연결하기 위해 CDL이라는 형식적 중간 표현을 사용합니다.

arxiv arXiv cs.CL · 26일 전 · 조회수 1회

연구진이 차량 내 브라질 수화 인식을 위한 ICSL 데이터셋 공개

택시 및 라이드셰어링 플랫폼과 같은 공유 모빌리티 서비스 내에서 수화를 사용하는 과제를 해결하기 위해 In-Car Sign Language (ICSL) 코퍼스라고 불리는 새로운 멀티모달 데이터셋이 도입되었습니다. 이 리소스는 제한된 차량 내부 환경에서 난청 및 청각 장애인 커뮤니티의 대중교통 접근성을 개선하기 위해 브라질 수화(Libras)에 중점을 둡니다.

arxiv arXiv cs.CL · 26일 전

독일어와 영어 복합어의 구성성에 대한 시간 경과에 따른 작은 부정적 경향 연구 발견

연구자들은 Compositionality Trend Prediction 작업을 도입하고 새로운 시대별 동기적 평가 데이터셋을 대상으로 평가함으로써, 23개의 독일어 및 26개의 영어 명사 복합어에서 의미 변화를 조사했습니다. 복합어가 구성성을 잃는 방향으로 결정적인 경향을 보인다고 주장하는 기존 문헌과 대조적으로, 이 연구는 시간 경과에 따른 작은 부정적 경향만 발견했습니다.

arxiv arXiv cs.CL · 26일 전

JobHop v2: 비정형 이력서에서 대규모 경력 궤적 데이터셋

연구자들은 노동력 계획 및 노동 시장 분석을 위해 설계된 공개 JobHop 데이터셋의 개선된 버전인 JobHop v2를 출시했습니다. VDAB(플람스 공공 고용 서비스)에서 제공한 약 440,000개의 익명화된 다국어 이력서로부터 엔드투엔드 대규모 언어 모델 추출을 통해 구축되었으며, 이 데이터셋에는 355,315개의 경력 궤적이 포함되어 있습니다.

arxiv arXiv cs.LG · 26일 전

크라우드소싱된 컬렉션에서 키워드를 추출하기 위한 NLP 접근법 평가 연구

옥스퍼드 대학의 Their Finest Hour Online Archive를 사용한 프로젝트는 대규모 키워드 추출을 자동화하기 위해 개체명 인식, 키워드 추출, 주제 모델링이라는 세 가지 자연어 처리 접근법을 평가했습니다. 이 연구는 전통적인 통계 모델부터 최신 생성 AI 신경망에 이르기까지 다양한 기법에서 이러한 방법들을 테스트했습니다.