IBM开源CodeAlchemy,一个包含高质量代码的海量合成数据集
IBM已开源CodeAlchemy,这是一个旨在通过将代码与执行轨迹配对来提升AI模型性能的管道和合成数据集。此次发布的数据集涵盖近1万亿个token,涉及15种编程语言,总量至少是维基百科的200倍。
IBM已开源CodeAlchemy,这是一个旨在通过将代码与执行轨迹配对来提升AI模型性能的管道和合成数据集。此次发布的数据集涵盖近1万亿个token,涉及15种编程语言,总量至少是维基百科的200倍。
用户 helloadhavan 创建了一个名为 CC-FilteredCorpus 的数据集,旨在过滤 Common Crawl 并提取干净的 Markdown 内容。该项目旨在保留有用的文档结构,包括标题、列表、链接、代码块和表格,而不是将所有内容扁平化为纯文本。
作者介绍了 Calibra,这是一个开源工具包,旨在分析和确保机器人学习数据集的完整性。该工具旨在在训练开始前识别有问题的数据,从而避免计算资源的浪费。
一位研究人员发布了OpenGauntlet研究目录,这是一个公共资源,包含关于168个文本转语音(TTS)系统和106个语音转文本(STT)系统的信息。该目录涵盖开源和托管模型、许可证、硬件要求、语言、功能、生命周期状态、来源信息以及可用的已发布基准数据。
已为 Hugging Face Hub 上的所有 4893 个印度语言数据集发布了每月更新的合规矩阵,截至 2026 年 8 月 1 日,其中 65.1% 未声明任何许可证标签。
Calibra v0.7.1 引入了一个新的数据集完整性(Dataset Integrity)阶段,该阶段在质量和覆盖率分析之前运行,帮助用户验证其机器人数据集是否可靠。
Calibra 是一个开源工具包,旨在帮助研究人员在训练策略之前审计机器人数据集并识别质量问题。首次公开发布包括一个用于审计 LeRobot 数据集的 Robot Dataset Health Check 交互式 Space,以及包含健康评分的 30 个公开 LeRobot 数据集的基准测试。
Huggy Engine 已在 Hugging Face 上发布了 Huggy Database,据称是目前可用的最大开源法国赛马数据集。该发布内容提供了从 1996 年到 2026 年共 30 年的完整每日数据覆盖,可用于机器学习应用。
Hugging Face 发布了 The Stack v3,据称是迄今为止最大的开源代码数据集。此次发布提供了两种不同的访问方式以满足不同用户的需求。
louidev 已在 Hugging Face 上发布了 GlassBallAI 数据集,捕捉了 Google 的 Gemini 模型在结果未知前的实时预测行为。该数据集包含超过 3,655 行数据,收集于 2026 年 2 月 17 日至 5 月 19 日之间,涵盖 Gemini 2.5 Flash、2.5 Pro、2.5 Flash Lite 和 3.0 Flash Preview。
一位用户分享了从物理模拟(如流体流动和结构场)生成训练数据集的计算成本经验。他强调,主要挑战不在于模型架构,而在于当每个样本的生产成本高昂时,构建大规模且多样化数据集的难度。