연구자들은 생물학, 물리학, 화학 분야의 전문가들이 작성한 448개의 다중 선택 질문으로 구성된 도전적인 데이터셋 GPQA를 제시합니다. 이 벤치마크는 극도로 어렵도록 설계되었으며, 박사 수준의 전문가도 정확도 65%만 달성하고, 숙련된 비전문가는 제한 없는 웹 접근 권한이 있음에도 불구하고 34%에 불과합니다. 최첨단 AI 시스템도 어려움을 겪고 있으며, 가장 강력한 GPT-4 기준선도 정확도 39%만 달성합니다. 인간과 프론티어 모델 모두에게 이러한 어려움은 과학 지식 발전에서 AI 출력을 감독하기 위한 현실적이고 확장 가능한 감독 실험을 가능하게 하는 것을 목표로 합니다.
GPQA: 대학원 수준의 Google 방지 Q&A 벤치마크
벤치마크
| 벤치마크 | 모델 | 점수 |
|---|---|---|
| GPQA Diamond | GPT-4 based baseline | 39% |
연구자가 LLM 간 합의 불명확성을 해결하기 위해 독립적인 한 명의 주석 작성자를 구함
한 연구자는 판독자 간 낮은 일치율이 과제의 해석적 성격에서 비롯된 것인지, 아니면 모호한 주석 정의에서 비롯된 것인지를 파악하기 위해 100개의 터키어 내러티브 장면을 라벨링할 독립적인 인간 주석 작성자 한 명을 요청하고 있습니다. 연구 결과, 네 개의 LLM과 규칙 기반 검출기가 서로 그리고 인간 기준과 약간의 수준으로 일치했으며, Cohen’s κ 점수는 0.000에서 0.185 사이였습니다.
고립 테스트는 통과하지만 문맥적 복사에 실패하는 'FragileTokens'를 식별한 연구
연구는 "FragileTokens"를 특성화했는데, 이는 개방형 가중치 언어 모델의 어휘 항목으로, 고립되었을 때는 성공적으로 복사되지만 주변 텍스트에 삽입되면 오류를 보입니다. 이 연구는 표준 고립 테스트가 문자 그대로의 정체성 보존을 보장하지 않는다고 강조합니다. 시퀀스 내에서 토큰이 삭제, 대체 또는 잘릴 수 있기 때문입니다.
GPT-5와 GPT-5 Nano가 미생물 발암 연구 평가에서 전문가 수준에 도달
GPT-5와 GPT-5 Nano가 미생물 발암 관련 연구 논문의 증거 추출 및 비판적 평가에서 전문가 수준의 성능을 달성했음을 보여주는 연구 결과가 발표되었습니다. 연구진은 MMTV-LV와 유방암에 초점을 맞춘 24편의 논문 데이터셋을 사용하여 도메인 전문가들과 함께 Gemini 2.5 Pro 및 Gemini 2.5 Flash 모델과 함께 이러한 모델들을 벤치마킹했습니다.
GPT-5와 GPT-5 Nano가 미생물 발암 증거 추출에서 전문가 수준에 도달
미생물 발암에 대한 체계적 증거 합성을 대상으로 대규모 언어 모델을 벤치마킹한 연구 결과, GPT-5와 GPT-5 Nano가 도메인 전문가와 구별되지 않는 성능을 보였다고 밝혔다. 연구진은 Gemini 2.5 Pro, Gemini 2.5 Flash, GPT-5, GPT-5 Nano를 여러 질문 유형에 걸쳐 77개 항목으로 구성된 구조화된 템플릿을 사용하여 24편의 연구 논문에 대해 평가했다.
M$^3$R-Bench는 다중 모달 은유 이해를 위한 증거 기반 벤치마크를 소개합니다
연구자들은 증거 기반 다중 모달 은유 이해를 평가하기 위해 설계된 인간 검증 주석이 포함된 1,000개의 이미지-텍스트 인스턴스를 포함하는 통합 벤치마크인 M$^3$R-Bench를 소개합니다. 이 벤치마크는 개념적 은유 이론에 기반한 은유 발생, 대상-소스 매핑, 감정 및 단계별 설명에 대한 결합 주석을 제공합니다.