研究人员提出了GPQA,这是一个具有挑战性的数据集,包含448道由生物学、物理学和化学领域专家编写的多项选择题。 该基准测试被设计为极其困难;博士级专家仅达到65%的准确率,而熟练的非专家即使拥有不受限制的网页访问权限,准确率也仅为34%。最先进的AI系统也面临困难,最强的GPT-4基线准确率仅为39%。 这种对人类和前沿模型都构成的难度旨在使监督AI在科学知识发展中的输出成为可能,从而实现现实且可扩展的监督实验。
arxiv
Moonshot AI (arXiv)
·
1038 天前
GPQA:研究生级别的防Google问答基准
译自 English → 中文
Benchmarks
| Benchmark | 模型 | 得分 |
|---|---|---|
| GPQA Diamond | GPT-4 based baseline | 39% |
相关文章
media
Hugging Face Forums
·
3 天前
·
16 次浏览
研究者寻求一名独立标注员以解决LLM协议歧义
一位研究者请求一名独立的真人标注员对100个土耳其语叙事场景进行标注,以确定低评分者间一致性是源于任务的解释性本质,还是由于标注定义不明确。研究发现,四个大型语言模型和一个基于规则的检测器彼此之间以及与人类参考标准的一致性大致处于随机水平,Cohen’s κ得分范围在0.000到0.185之间。
media
Hugging Face Forums
·
10 天前
·
24 次浏览
研究识别出在通过隔离探针后仍无法进行上下文复制的脆弱标记
一项研究对“脆弱标记”进行了刻画,这些是开放权重语言模型中的词汇条目,它们在孤立时能够成功复制,但在嵌入周围文本时会表现出错误。该研究强调,标准隔离测试并不能保证字面身份的保留,因为标记在序列中可能会被删除、替换或截断。
arxiv
arXiv cs.AI
·
44 天前
·
40 次浏览
GPT-5和GPT-5 Nano在微生物致癌研究评估中与专家表现相当
一项研究表明,GPT-5和GPT-5 Nano在提取证据和批判性评估微生物致癌研究出版物方面达到了专家级水平。研究人员使用包含24篇聚焦于MMTV-LV和乳腺癌的论文的数据集,将这些模型与Gemini 2.5 Pro和Gemini 2.5 Flash以及领域专家进行了基准测试。
arxiv
arXiv cs.CL
·
44 天前
·
41 次浏览
GPT-5 和 GPT-5 Nano 在微生物致癌证据提取方面与专家表现相当
一项针对大型语言模型在微生物致癌系统性证据合成方面的基准测试发现,GPT-5 和 GPT-5 Nano 的表现与领域专家难以区分。研究人员使用包含多个问题类型的77项结构化模板,对 Gemini 2.5 Pro、Gemini 2.5 Flash、GPT-5 和 GPT-5 Nano 在24篇研究论文上进行了评估。
arxiv
arXiv cs.CL
·
47 天前
·
34 次浏览
M$^3$R-Bench推出面向多模态隐喻理解的证据支撑基准
研究人员推出了M$^3$R-Bench,这是一个统一的基准测试集,包含1,000个经过人工验证标注的图像-文本实例,旨在评估基于证据的多模态隐喻理解能力。该基准测试为隐喻出现、目标-源映射、情感以及基于概念隐喻理论的阶段性解释提供了联合标注。