ユーザーYoung25はHugging FaceにHumor_Voteデータセットをリリースし、中国語ユーモアに関するモデルの評価とトレーニングのためのリソースを提供しました。このデータセットは、ネイティブな中国語のユーモア質問と4つの候補回答、および対応する人間の投票数で構成されています。

  • 各行にはquestion_cnフィールド、4つの回答フィールド(answer_cn_0からanswer_cn_3)、chosen_cnラベル、および各回答の投票数が含まれています。
  • 自然な表現やオチを保持するため、すべてのコンテンツは翻訳テキストではなくネイティブな中国語です。
  • データ構造はSFT、DPOスタイルの好みペア、報酬モデル化、またはモデルのユーモア評価のためのプローブとして直接使用をサポートします。
  • パーティーアイスブレーカー、クイズゲーム、ユーモアコンテンツ生成などのエンターテインメントアプリケーションにも適しています。

このリリースは、ユーモア評価と好みデータに取り組む研究者を支援することを目的としており、著者はフォーマットとラベルの品質に関するフィードバックを歓迎しています。