QuantVectors는 힌디어, 마라티어, 구자라티어, 벵골어, 펀자브어, 타밀어, 우르두어, 텔루구어, 오디아어, 칸나다어, 말라얄람어, 아삼어 등 인도의 인디크 언어로 주석이 달린 문서 데이터셋을 찾고 있습니다. 데이터셋에는 송장, 영수증, 공공요금 고지서, 지급 안내, 포장 목록, 상업용 송장, 신용고지서가 포함되어야 하며, 언어당 약 400개의 문서, 인간 검증 주석, 99% 이상의 정확도가 필요합니다. 데이터셋은 상업적으로 라이선스 가능해야 하며 오픈소스 또는 상업용일 수 있으며, HuggingFace 데이터셋, 연구용 데이터셋 또는 이 분야를 전문으로 하는 벤더를 요청합니다.
media
Hugging Face Forums
·
93일 전
·
open_models
인도 AI/OCR 훈련을 위한 인디크 문서 데이터셋 모색
번역 English → 한국어
관련 기사
media
Hugging Face Forums
·
29일 전
·
조회수 39회
vldmrbesk가 측정된 인식 정확도를 갖춘 51,000장 분량 티olkovsky 아카이브 공개
자습형 로켓 이론가인 콘스탄틴 치올코프스키의 완전한 개인 아카이브(51,008장 및 2,019개 아카이브 파일로 구성)가 CC0 데이터셋으로 공개되었습니다. 이 컬렉션은 그의 50년 간의 작업을 아우르며, 필사 원고와 타자본이 함께 포함되어 있습니다.
media
r/LocalLLaMA
·
61일 전
·
조회수 56회
Hugging Face, 최대 규모 오픈 코드 데이터셋 'The Stack v3' 출시
Hugging Face는 지금까지 가장 큰 오픈 코드 데이터셋인 The Stack v3를 출시했습니다. 이번 릴리스는 다양한 사용자의 요구를 충족하기 위해 두 가지 서로 다른 접근 방법을 제공합니다.
lab
IBM Research (Granite)
·
68일 전
·
조회수 31회
IBM이 고품질 코드의 방대한 합성 데이터셋인 CodeAlchemy를 오픈소스로 공개
IBM은 코드와 실행 트레이스를 페어링하여 AI 모델 성능을 향상시키기 위해 설계된 파이프라인 및 합성 데이터셋인 CodeAlchemy를 오픈소스로 공개했습니다. 이번 릴리스에는 15개 프로그래밍 언어에 걸쳐 거의 1조 개의 토큰이 포함되어 있으며, 이는 위키백과 크기의 최소 200배에 해당합니다.
arxiv
arXiv cs.CL
·
80일 전
·
조회수 27회
MultiSynt/MT, 36개 언어에 걸친 4.8T 토큰 병렬 코퍼스 공개
연구자들은 36개 유럽 언어에 걸쳐 약 4.8조 개의 대상 언어 토큰을 포함하는 오픈 합성 병렬 코퍼스인 MultiSynt/MT를 소개했습니다. 이 데이터셋은 Tower+ 및 OPUS-MT/HPLT-MT 시스템을 사용하여 1000억 개의 고품질 Nemotron-CC 토큰을 번역하여 생성되었습니다.
blog
Simon Willison
·
81일 전
·
조회수 22회
Current AI, 421개 제품으로 오픈 소스 AI 격차 지도 v0.1 출시
2025년 2월 AI Action Summit에서 설립된 비영리団体 Current AI는 오픈 소스 AI의 현황을 색인하기 위해 'Open Source AI Gap Map v0.1'을 출시했습니다.