研究者らは、生物学、物理学、化学の分野の専門家が作成した448問の多肢選択式問題からなる挑戦的なデータセットGPQAを発表しました。 このベンチマークは極めて困難になるように設計されており、博士課程レベルの専門家でも正答率は65%にとどまり、スキルのある非専門家でも unrestricted なウェブアクセスがあるにもかかわらず34%に留まります。最先端のAIシステムも苦戦しており、最も強力なGPT-4ベースラインでも正答率はわずか39%です。 人間とフロンティアモデルの両方にとってのこの難しさは、科学知識の発展におけるAI出力の監督のための現実的でスケーラブルな監視実験を可能にすることを目指しています。
GPQA: 大学院レベルのGoogle耐性Q&Aベンチマーク
ベンチマーク
| ベンチマーク | モデル | スコア |
|---|---|---|
| GPQA Diamond | GPT-4 based baseline | 39% |
M$^3$R-Benchがマルチモーダル比喩理解のための根拠付きベンチマークを導入
研究者らは、根拠に基づくマルチモーダル比喩理解を評価するために設計された、人間による検証済み注釈を含む1,000の画像-テキストインスタンスからなる統合ベンチマークであるM$^3$R-Benchを導入した。このベンチマークは、比喩の発生、ターゲットとソースのマッピング、感情、および概念メタファー理論に基づく段階的な説明に対する共同注釈を提供する。
ZingフレームワークがSoMBenchベンチマークとActioグラウンディングによりLLMの社会的知能を向上
本レポートでは、大規模言語モデルの社会的知能を測定し、内部化し、グラウンディングすることで強化することを目的とした統合フレームワークであるZingを紹介しています。著者らは、17の二次次元と3,481件の専門家検証済みインスタンスにわたる心理学基盤のベンチマークであるSoMBenchを発表しました。これにより、現在のLLMには大幅な改善の余地があり、どのモデルもほぼ天井性能に達していないことが明らかになりました。
SRRMベンチマークにより、Qwen2.5-1.5Bが長文脈メモリにおいて3Bを上回ることを発見
ある研究者が、Small Language Modelsの長文脈メモリを評価するために設計された軽量ベンチマークであるSimple Retrieval-Reconstruction Memory (SRRM)を紹介する論文に対するarXiv cs.CLの推薦を求めています。
特性を用いたLLMファインチューニングはクロスルーブリックエッセイ採点の改善につながる
研究者たちは、教育者がルーブリックを改訂または新規導入する際に生じる自動化エッセイ採点の課題、すなわち「クロスルーブリック一般化」というシナリオに対処しています。彼らは、トレーニング中にターゲットエッセイの教師ありデータと併用して、「特性(traits)」と呼ばれるルーブリック非依存の中間表現を活用する大規模言語モデルのためのファインチューニングフレームワークを提案します。
生グルバニ追跡:シク教徒のキルタン字幕作成のためのベンチマークとリファレンスシステム
著者らは、スリ・グル・グランサ・サヒブ・ジの節の継続的な歌唱朗読を含む、シク教徒のキルタンのライブ字幕付けのためのベンチマークとリファレンスシステムを発表します。オープンボキャブラリトランスクリプションとは異なり、このタスクでは宗教的に不適切な誤記を避けるために、正典聖書からの正確な単語ごとの一致が必要です。