NewTypeCola发布包含66,010页的韩国VOKU档案数据集
NewTypeCola在Hugging Face上发布了VOKU Archive,这是一份由韩国学生运营的校园广播电台提示单(cue sheets)组成的66,010页扫描文档合集。这些文档涵盖1988年至2019年,包含OCR文本、伪名标记注释和元数据。
NewTypeCola在Hugging Face上发布了VOKU Archive,这是一份由韩国学生运营的校园广播电台提示单(cue sheets)组成的66,010页扫描文档合集。这些文档涵盖1988年至2019年,包含OCR文本、伪名标记注释和元数据。
研究人员推出了 VideoX-Qwen,这是一个集成框架,将可扩展的数据构建与模型训练相结合,以推进通用、指令驱动的视频编辑。该系统利用生产流水线组织专用模型生成方向性编辑记录,从而在添加、删除、替换和属性任务中产生超过 120 万份高质量样本。
一位计算语言学家和豪萨语自然语言处理专家推出了一个新的数据集,旨在豪萨语语境下评估大语言模型在医疗保健和安全方面的表现。
FlyEye 项目发布了首个紧凑型神经元级数据集,以及配套的浏览器和运行时开发工具包。本次发布包括托管在 Hugging Face 上的 Tubban/flyeye-escape-neuron-v1 数据集。
Adaption Labs推出了“Invent a Dataset”功能,该功能可直接从自然语言任务描述生成结构化、可用于训练的数据集,无需种子语料库、预定义模式或标注指南。该工具可通过Adaption应用、Python SDK和REST API使用,用户可下载生成的行数据,格式包括JSONL、JSON、CSV或Parquet。
作者介绍了TrialGPT 2.0,这是一个面向实际部署的AI辅助临床试验推荐系统,可根据患者需求和流程优先级评估哪些试验值得考虑。