연구자들은 생물학, 물리학, 화학 분야의 전문가들이 작성한 448개의 다중 선택 질문으로 구성된 도전적인 데이터셋 GPQA를 제시합니다. 이 벤치마크는 극도로 어렵도록 설계되었으며, 박사 수준의 전문가도 정확도 65%만 달성하고, 숙련된 비전문가는 제한 없는 웹 접근 권한이 있음에도 불구하고 34%에 불과합니다. 최첨단 AI 시스템도 어려움을 겪고 있으며, 가장 강력한 GPT-4 기준선도 정확도 39%만 달성합니다. 인간과 프론티어 모델 모두에게 이러한 어려움은 과학 지식 발전에서 AI 출력을 감독하기 위한 현실적이고 확장 가능한 감독 실험을 가능하게 하는 것을 목표로 합니다.
GPQA: 대학원 수준의 Google 방지 Q&A 벤치마크
벤치마크
| 벤치마크 | 모델 | 점수 |
|---|---|---|
| GPQA Diamond | GPT-4 based baseline | 39% |
M$^3$R-Bench는 다중 모달 은유 이해를 위한 증거 기반 벤치마크를 소개합니다
연구자들은 증거 기반 다중 모달 은유 이해를 평가하기 위해 설계된 인간 검증 주석이 포함된 1,000개의 이미지-텍스트 인스턴스를 포함하는 통합 벤치마크인 M$^3$R-Bench를 소개합니다. 이 벤치마크는 개념적 은유 이론에 기반한 은유 발생, 대상-소스 매핑, 감정 및 단계별 설명에 대한 결합 주석을 제공합니다.
Zing 프레임워크가 SoMBench 벤치마크와 Actio 기반 추론을 통해 LLM의 사회적 지능을 향상
이 보고서는 Zing를 소개합니다. Zing는 대규모 언어 모델의 사회적 지능을 측정하고, 내재화하며, 기반 추론함으로써 향상시키는 데 설계된 통합 프레임워크입니다. 저자들은 17개의 하위 차원과 3,481명의 전문가가 검증한 인스턴스를 아우르는 심리학 기반 벤치마크인 SoMBench를 제시합니다. 이는 현재 LLM에 상당한 개선의 여지가 있으며 어떤 모델도 거의 최고점 성능에 도달하지 못했음을 보여줍니다.
SRRM 벤치마크는 Qwen2.5-1.5B가 긴 컨텍스트 메모리에서 3B를 능가함을 보여줍니다
한 연구자가 Small Language Models의 긴 컨텍스트 메모리를 평가하도록 설계된 경량 벤치마크인 Simple Retrieval-Reconstruction Memory (SRRM)을 소개하는 논문에 대한 arXiv cs.CL 승인을 찾고 있습니다.
특성 기반 LLM 파인튜닝은 크로스 루브릭 에세이 채점 성능을 향상시킵니다
연구자들은 교육자가 루브릭을 수정하거나 새로 도입할 때 발생하는 자동 에세이 채점의 과제, 즉 크로스 루브릭 일반화라는 시나리오에 대응합니다. 그들은 훈련 중 타겟 에세이 감독과 함께 '특성(traits)'이라는 루브릭 비종속 중간 표현을 활용하는 대규모 언어 모델용 파인튜닝 프레임워크를 제안합니다.
라이브 구르바니 추적: 시크 교의 키르탄 자막 작성을 위한 벤치마크 및 참조 시스템
저자들은 스리 구루 그란트 사히브 지의 절에 대한 지속적인 노래 암송을 포함하는 시크 교의 키르탄 라이브 자막 작성을 위한 벤치마크 및 참조 시스템을 제시합니다. 오픈 어휘 전사와 달리 이 작업은 종교적으로 부적절한 오타를 피하기 위해 정전 성서로부터의 정확한 단어 대 단어 일치가 필요합니다.