NewTypeCola, 66,010페이지 분량의 한국어 VOKU 아카이브 데이터셋 공개
NewTypeCola가 Hugging Face에 VOKU Archive를 게시했습니다. 이는 한국의 학생 운영 캠퍼스 라디오 방송 큐 시트(cue sheets)에서 수집한 66,010장의 스캔 페이지 모음입니다. 문서는 1988년부터 2019년까지 span하며 OCR 텍스트, 가명 토큰 주석 및 메타데이터를 포함합니다.
NewTypeCola가 Hugging Face에 VOKU Archive를 게시했습니다. 이는 한국의 학생 운영 캠퍼스 라디오 방송 큐 시트(cue sheets)에서 수집한 66,010장의 스캔 페이지 모음입니다. 문서는 1988년부터 2019년까지 span하며 OCR 텍스트, 가명 토큰 주석 및 메타데이터를 포함합니다.
연구원들은 확장 가능한 데이터 구축과 모델 학습을 결합하여 범용 지시 기반 비디오 편집을 발전시키는 통합 프레임워크인 VideoX-Qwen을 제시했습니다. 이 시스템은 방향성 편집 레코드를 생성하기 위해 특수화된 모델을 조직하는 생산 파이프라인을 활용하며, 추가, 제거, 교체 및 속성 작업에 걸쳐 120만 개 이상의 고품질 샘플을 생성합니다.
전산 언어학자이자 하우사어 NLP 전문가가 하우사어 맥락에서 의료 및 안전성을 위한 대규모 언어 모델을 평가하기 위해 설계된 새로운 데이터셋을 소개했습니다.
FlyEye 프로젝트는 브라우저 및 런타임 개발 키트와 함께 최초의 컴팩트 뉴론 레벨 데이터셋을 공개했습니다. 이번 릴리스에는 Hugging Face에 호스팅된 Tubban/flyeye-escape-neuron-v1 데이터셋이 포함됩니다.
Adaption Labs는 시드 코퍼스, 사전 정의된 스키마, 또는 라벨링 가이드 없이 자연어 작업 설명에서 구조화된 훈련 준비 완료 데이터셋을 직접 생성하는 기능인 "Invent a Dataset"을 소개했습니다. 이 도구는 Adaption 앱, Python SDK 및 REST API를 통해 사용할 수 있으며, 사용자는 JSONL, JSON, CSV 또는 Parquet 형식으로 생성된 행을 다운로드할 수 있습니다.
저자들은 TrialGPT 2.0을 제시합니다. 이는 환자 요구와 워크플로우 우선순위에 기반하여 어떤 임상 시험을 고려할 가치가 있는지 평가하는 실제 배포를 위해 설계된 AI 보조 임상 시험 추천 시스템입니다.