研究人员提出了GPQA,这是一个具有挑战性的数据集,包含448道由生物学、物理学和化学领域专家编写的多项选择题。 该基准测试被设计为极其困难;博士级专家仅达到65%的准确率,而熟练的非专家即使拥有不受限制的网页访问权限,准确率也仅为34%。最先进的AI系统也面临困难,最强的GPT-4基线准确率仅为39%。 这种对人类和前沿模型都构成的难度旨在使监督AI在科学知识发展中的输出成为可能,从而实现现实且可扩展的监督实验。
arxiv
Moonshot AI (arXiv)
·
993 天前
GPQA:研究生级别的防Google问答基准
译自 English → 中文
Benchmarks
| Benchmark | 模型 | 得分 |
|---|---|---|
| GPQA Diamond | GPT-4 based baseline | 39% |
相关文章
arxiv
arXiv cs.CL
·
2 天前
M$^3$R-Bench推出面向多模态隐喻理解的证据支撑基准
研究人员推出了M$^3$R-Bench,这是一个统一的基准测试集,包含1,000个经过人工验证标注的图像-文本实例,旨在评估基于证据的多模态隐喻理解能力。该基准测试为隐喻出现、目标-源映射、情感以及基于概念隐喻理论的阶段性解释提供了联合标注。
arxiv
arXiv cs.CL
·
12 天前
Zing框架通过SoMBench基准和Actio接地提升大语言模型的社会智能
该报告介绍了Zing,一个旨在通过测量、内化和接地社会能力来增强大型语言模型社会智能的综合框架。作者提出了SoMBench,这是一个基于心理学的基准测试,涵盖17个二级维度和3,481个经专家验证的实例,结果显示当前大语言模型仍有显著的提升空间,没有任何模型达到接近天花板的表现。
media
Hugging Face Forums
·
15 天前
·
2 次浏览
SRRM基准测试显示Qwen2.5-1.5B在长上下文记忆方面优于3B
一位研究人员正在寻求arXiv cs.CL的推荐,以发表一篇介绍简单检索重建记忆(Simple Retrieval-Reconstruction Memory, SRRM)的论文。SRRM是一个轻量级基准测试,旨在评估小型语言模型中的长上下文记忆能力。
arxiv
arXiv cs.CL
·
24 天前
使用特质微调大语言模型可提升跨评分标准作文评分
研究人员解决了自动作文评分的挑战,即当教育工作者修订或引入新评分标准时,这种情况被称为跨评分标准泛化。他们提出了一种针对大型语言模型的大规模微调框架,该框架利用称为“特质”的与评分标准无关的中间表示,并在训练期间结合目标作文的监督。
arxiv
arXiv cs.CL
·
24 天前
实时古尔巴尼追踪:锡克教基尔坦字幕的基准与参考系统
作者提出了一种用于锡克教基尔坦(Sikh Kirtan)实时字幕的基准测试和参考系统,该系统涉及对《斯里古鲁格兰特·萨希卜》(Sri Guru Granth Sahib Ji)经文诗句的连续吟唱。与开放词汇转录不同,此任务要求与正典经文逐字精确匹配,以避免出现宗教上不恰当的拼写错误。