用户Young25在Hugging Face上发布了Humor_Vote数据集,为评估和训练中文幽默模型提供了资源。该数据集由原生中文幽默问题与四个候选答案及对应的人类投票计数组成。

  • 每行包含一个question_cn字段、四个答案字段(answer_cn_0至answer_cn_3)、chosen_cn标签以及每个答案的投票计数。
  • 所有内容均为原生中文而非翻译文本,以保留自然措辞和笑点。
  • 数据结构支持直接用于SFT、DPO风格的偏好对、奖励建模,或作为模型幽默评估的探针。
  • 它也适用于娱乐应用,如派对破冰游戏、问答游戏和幽默内容生成。

此次发布旨在协助从事幽默评估和偏好数据研究的研究人员,作者欢迎就格式和标签质量提供反馈。