研究者らは、生物学、物理学、化学の分野の専門家が作成した448問の多肢選択式問題からなる挑戦的なデータセットGPQAを発表しました。 このベンチマークは極めて困難になるように設計されており、博士課程レベルの専門家でも正答率は65%にとどまり、スキルのある非専門家でも unrestricted なウェブアクセスがあるにもかかわらず34%に留まります。最先端のAIシステムも苦戦しており、最も強力なGPT-4ベースラインでも正答率はわずか39%です。 人間とフロンティアモデルの両方にとってのこの難しさは、科学知識の発展におけるAI出力の監督のための現実的でスケーラブルな監視実験を可能にすることを目指しています。
GPQA: 大学院レベルのGoogle耐性Q&Aベンチマーク
ベンチマーク
| ベンチマーク | モデル | スコア |
|---|---|---|
| GPQA Diamond | GPT-4 based baseline | 39% |
研究者、LLMの合意不確実性を解消するため独立した1名の注釈担当者を募集
ある研究者は、タスクの解釈的性質に起因するのか、あるいは注釈定義が未確定であることに起因するのかを判断するために、100のトルコ語物語シーンをラベル付けする単一の独立した人間注釈担当者の依頼を行っている。本研究では、4つのLLMとルールベースの検出器が互いに、かつ人間の参照データとほぼ偶然レベルで合意しており、Cohen’s κスコアは0.000から0.185の範囲であった。
孤立プローブを通過しても文脈コピーに失敗する「FragileTokens」を特定した研究
ある研究は、「FragileTokens」と呼ばれる語彙項目を特徴づけている。これはオープンウェイト言語モデルにおける語彙エントリで、孤立した状態ではコピーに成功するが、周囲のテキスト中に埋め込まれるとエラーを示すものである。この研究は、標準的な孤立テストでは文字通りの同一性の保持が保証されないことを浮き彫りにしている。なぜなら、トークンはシーケンス内で削除されたり、置換されたり、切り詰められたりする可能性があるからである。
GPT-5とGPT-5 Nanoが微生物発がん研究の評価において専門家と同等の性能を示す
ある研究により、GPT-5およびGPT-5 Nanoが、微生物発がんに関する研究論文のエビデンス抽出および批判的評価において専門家レベルのパフォーマンスを達成することが示された。研究者らは、MMTV-LVおよび乳癌に焦点を当てた24編の論文からなるデータセットを用い、これらのモデルをGemini 2.5 ProおよびGemini 2.5 Flashと共にドメイン専門家と比較ベンチマークした。
GPT-5とGPT-5 Nanoは微生物発がんのエビデンス抽出において専門家と同等の性能を示す
微生物発がんに関する体系的エビデンス合成における大規模言語モデルのベンチマーク研究により、GPT-5およびGPT-5 Nanoがドメインの専門家と区別できないほど高いパフォーマンスを発揮することが明らかになった。研究者らは、Gemini 2.5 Pro、Gemini 2.5 Flash、GPT-5、GPT-5 Nanoを、複数の質問タイプにわたる77項目からなる構造化テンプレートを用いて24の研究論文で評価した。
M$^3$R-Benchがマルチモーダル比喩理解のための根拠付きベンチマークを導入
研究者らは、根拠に基づくマルチモーダル比喩理解を評価するために設計された、人間による検証済み注釈を含む1,000の画像-テキストインスタンスからなる統合ベンチマークであるM$^3$R-Benchを導入した。このベンチマークは、比喩の発生、ターゲットとソースのマッピング、感情、および概念メタファー理論に基づく段階的な説明に対する共同注釈を提供する。