QuantVectors 正在寻求来自印度的印地语系语言的标注文档数据集,包括印地语、马拉地语、古吉拉特语、孟加拉语、旁遮普语、泰米尔语、乌尔都语、泰卢固语、奥里亚语、卡纳达语、马拉雅拉姆语和阿萨姆语。数据集必须包含发票、收据、公用事业账单、付款建议、装箱单、商业发票和贷项通知单类型,每种语言约400份文档,人工验证的标注,以及99%以上的准确率。数据集必须可商业授权,可以是开源或商业性质,并请求提供HuggingFace数据集、研究数据集或专注于此领域的供应商。
media
Hugging Face Forums
·
93 天前
·
open_models
寻求用于印度AI/OCR训练的印地语系文档数据集
译自 English → 中文
相关文章
media
Hugging Face Forums
·
29 天前
·
39 次浏览
vldmrbesk 发布包含精确识别准确率的齐奥尔科夫斯基档案(5.1万页)
康斯坦丁·齐奥尔科夫斯基的完整个人档案,共包含 51,008 页和 2,019 个档案文件,已作为 CC0 数据集发布。该合集跨越了这位自学成才的火箭理论家五十年的工作成果,包括手写手稿与打字副本。
media
r/LocalLLaMA
·
61 天前
·
56 次浏览
Hugging Face 发布 The Stack v3,最大的开源代码数据集
Hugging Face 发布了 The Stack v3,据称是迄今为止最大的开源代码数据集。此次发布提供了两种不同的访问方式以满足不同用户的需求。
lab
IBM Research (Granite)
·
68 天前
·
31 次浏览
IBM开源CodeAlchemy,一个包含高质量代码的海量合成数据集
IBM已开源CodeAlchemy,这是一个旨在通过将代码与执行轨迹配对来提升AI模型性能的管道和合成数据集。此次发布的数据集涵盖近1万亿个token,涉及15种编程语言,总量至少是维基百科的200倍。
arxiv
arXiv cs.CL
·
80 天前
·
27 次浏览
MultiSynt/MT 发布涵盖36种语言的4.8T token并行语料库
研究人员推出了 MultiSynt/MT,这是一个开放的合成平行语料库,包含约4.8万亿个目标语言token,覆盖36种欧洲语言。该数据集通过使用 Tower+ 和 OPUS-MT/HPLT-MT 系统翻译1000亿个高质量的 Nemotron-CC token 生成。
blog
Simon Willison
·
81 天前
·
22 次浏览
Current AI 发布开源 AI 差距地图 v0.1,收录 421 个产品
Current AI 是一家于 2025 年 2 月 AI Action Summit 上成立的非营利组织,已发布 Open Source AI Gap Map v0.1,用于索引开源 AI 的现状。