벤치마크 · reasoning
Humanity's Last Exam
Humanity's Last Exam(HLE)은 수학, 자연과학, 인문학 등 여러 분야에 걸친 최전선의 전문가 수준 문제로 이루어진 벤치마크로, AI에게 극도로 어렵도록 의도적으로 설계되었습니다. 성능은 정확도(백분율)로 보고합니다.
자세히 보기
- 예시
- 각 문항은 정답이 하나로 정해진 전문가 수준의 질문으로, 예컨대 고급 수학 문제나 대학원 수준의 과학 문제(일부는 이미지 포함)를 객관식 또는 정확한 단답 형식으로 제시합니다.
- 채점 방식
- 지표는 정확도(accuracy)로, 모델이 올바르게 답한 문항의 비율(백분율)입니다. 일부 버전은 정확도와 함께 보정(신뢰도) 지표도 함께 보고합니다.
- 검증 방식
- 각 문항에는 알려진 정답이 있으며, 모델의 답은 그 기준 정답과 자동으로 대조해 채점합니다(객관식은 올바른 선택지, 단답은 일치 여부). 사람의 투표가 아니라 객관적인 자동 채점입니다.
- 왜 중요한가
- 일반적인 벤치마크는 이미 포화 상태(최상위 모델이 상한에 근접)여서, HLE는 인간 전문가 지식의 최전선에서 어렵고 변별력 있는 시험을 지향하며, AI가 전문가 수준의 추론에서 얼마나 떨어져 있는지를 가늠하는 의미 있는 척도가 됩니다.
예제 풀이
문제
벌새(Apodiformes 목)는 독특하게 좌우 한 쌍의 타원형 종자골(sesamoid)을 가지며, 이는 m. depressor caudae(꼬리를 내리는 근육) 부착부의 확장된 십자형 널힘줄(aponeurosis) 꼬리쪽 가쪽 부분에 박혀 있다. 이 종자골은 몇 쌍의 힘줄(tendons)을 지지하는가? 하나의 정수로 답하라.
해답
4
풀이
타원형 종자골은 꼬리 내림근의 십자형 널힘줄 안에서 형성되어 그 부착부의 네 쌍의 힘줄을 지지하며, 이는 벌새 꼬리 해부에 고유한 특수화된 골화이다. HLE는 제출된 정수를 기준 정답(4)과 정확히 일치시켜 채점하고, 보정을 위해 확신도를 별도로 수집한다.