연구자들은 MMLU-Pro를 소개했습니다. 이는 현재 대규모 언어 모델의 성능 포화 및 불안정성을 해결하도록 설계된 Massive Multitask Language Understanding 벤치마크의 향상된 버전입니다. 새로운 데이터셋은 선택지를 4개에서 10개로 확장하고, 어려운 대학 수준의 추론 질문을 통합하며, 전문가 검토를 통해 노이즈가 있는 항목을 제거했습니다.

  • MMLU와 비교해 정확도가 16%에서 33% 감소했으며, 상위 모델인 GPT-4o는 겨우 72.6%의 점수를 기록했습니다.
  • 프롬프트 변화에 대한 모델 점수 민감도는 MMLU의 4-5%에서 MMLU-Pro의 24가지 스타일 전반에 걸쳐 단 2%로 감소했습니다.
  • Chain of Thought 추론은 MMLU-Pro에서 성능을 크게 향상시켜 GPT-4o를 19% 개선한 반면, 원래 벤치마크에서는 결과에 부정적인 영향을 미쳤습니다.
  • 이 벤치마크는 14개 도메인과 12,000개 이상의 질문으로 구성되어 있어 GPT-4o와 GPT-4-Turbo 같은 모델 간 더 높은 판별력을 제공합니다.

MMLU-Pro는 전문가 수준의 언어 이해 및 추론 능력의 진전을 추적하기 위한 더 신뢰할 수 있고 어려운 지표로 작용합니다.