OpenGauntlet发布包含168个TTS和106个STT系统的目录
一位研究人员发布了OpenGauntlet研究目录,这是一个公共资源,包含关于168个文本转语音(TTS)系统和106个语音转文本(STT)系统的信息。该目录涵盖开源和托管模型、许可证、硬件要求、语言、功能、生命周期状态、来源信息以及可用的已发布基准数据。
一位研究人员发布了OpenGauntlet研究目录,这是一个公共资源,包含关于168个文本转语音(TTS)系统和106个语音转文本(STT)系统的信息。该目录涵盖开源和托管模型、许可证、硬件要求、语言、功能、生命周期状态、来源信息以及可用的已发布基准数据。
已为 Hugging Face Hub 上的所有 4893 个印度语言数据集发布了每月更新的合规矩阵,截至 2026 年 8 月 1 日,其中 65.1% 未声明任何许可证标签。
Calibra v0.7.1 引入了一个新的数据集完整性(Dataset Integrity)阶段,该阶段在质量和覆盖率分析之前运行,帮助用户验证其机器人数据集是否可靠。
Calibra 是一个开源工具包,旨在帮助研究人员在训练策略之前审计机器人数据集并识别质量问题。首次公开发布包括一个用于审计 LeRobot 数据集的 Robot Dataset Health Check 交互式 Space,以及包含健康评分的 30 个公开 LeRobot 数据集的基准测试。
Huggy Engine 已在 Hugging Face 上发布了 Huggy Database,据称是目前可用的最大开源法国赛马数据集。该发布内容提供了从 1996 年到 2026 年共 30 年的完整每日数据覆盖,可用于机器学习应用。
Hugging Face 发布了 The Stack v3,据称是迄今为止最大的开源代码数据集。此次发布提供了两种不同的访问方式以满足不同用户的需求。
louidev 已在 Hugging Face 上发布了 GlassBallAI 数据集,捕捉了 Google 的 Gemini 模型在结果未知前的实时预测行为。该数据集包含超过 3,655 行数据,收集于 2026 年 2 月 17 日至 5 月 19 日之间,涵盖 Gemini 2.5 Flash、2.5 Pro、2.5 Flash Lite 和 3.0 Flash Preview。
IBM已开源CodeAlchemy,这是一个旨在通过将代码与执行轨迹配对来提升AI模型性能的管道和合成数据集。此次发布的数据集涵盖近1万亿个token,涉及15种编程语言,总量至少是维基百科的200倍。
一位用户分享了从物理模拟(如流体流动和结构场)生成训练数据集的计算成本经验。他强调,主要挑战不在于模型架构,而在于当每个样本的生产成本高昂时,构建大规模且多样化数据集的难度。
研究人员提出了基于聚类的顺序特征选择(CSFS),这是一种新颖的基于聚类的包装器方法,用于可再生能源预测流水线中的自动且高效的特征选择。该方法解决了从大量可用的监测和环境变量中选择输入特征缺乏系统方法的问题。
研究人员提出了基于聚类的顺序特征选择(CSFS),这是一种新颖的、与模型无关的包装器方法,旨在解决风能和太阳能功率预测中缺乏系统性特征选择的问题。该方法旨在为可再生能源流水线提供自动、高效且可靠的特征选择。
研究人员推出了 ViHoRec,这是一个包含 18,267 次交互的公开数据集,涉及 6,832 名用户和 560 家酒店,用于越南酒店预订推荐。该资源利用 HMAC 伪名解决了跨平台实体解析和隐私保护发布方面的挑战。
研究人员推出了 FormalAnalyticGeo,这是一个可扩展的框架,用于全自动生成多模态解析几何问题,消除了人工标注的需求。该系统利用名为 CDL 的形式化中间表示,通过有符号距离场(Signed Distance Field)引擎将问题文本与精确的图表渲染连接起来。
研究人员开发了一种生物分子密码学方法,利用DNA折纸将秘密信息转换为纳米莫尔斯电码。这种方法旨在使用生物分子而不是传统的基于计算机的密码算法来保护信息。
一位用户基于“情绪正交模型”创建了一个衍生数据集,通过移除一个维度并将本体论聚类标签替换为10个表情符号类别。
一个新的多模态数据集——车载手语(In-Car Sign Language, ICSL)语料库——已被推出,旨在解决出租车和网约车等共享出行服务中使用手语所面临的挑战。该资源专注于巴西手语(Libras),以改善聋人和听障人士在狭窄车厢内部的公共交通可及性。
研究人员通过引入组合性趋势预测任务,对23个德语和26个英语名词复合词的语义变化进行了调查,并针对一个按十年划分的历时评分新数据集进行了评估。与文献中提出的复合词倾向于变得不那么具有组合性的决定性观点相反,研究发现随时间推移仅存在微小的负趋势。
研究人员发布了 JobHop v2,这是为劳动力规划和劳动力市场分析设计的公开可用 JobHop 数据集的改进版本。该数据集通过端到端的大型语言模型提取技术,从 VDAB(佛兰德公共就业服务机构)提供的约 440,000 份伪名化多语言简历中提取而成,包含 355,315 条职业轨迹。
一个使用牛津大学 Their Finest Hour Online Archive(他们最辉煌的时刻在线档案)的项目评估了三种自然语言处理(NLP)方法——命名实体识别、关键词提取和主题建模——以实现大规模自动关键词提取。该研究在一系列技术中测试了这些方法,从传统的统计模型到现代生成式人工智能神经网络。
研究人员提出了一种学习曲线收敛率的系统实证评估,以解决在基于惯性传感器的分类任务中确定最小样本量时缺乏数据驱动指南的问题。