GPT-5와 GPT-5 Nano가 미생물 발암 관련 연구 논문의 증거 추출 및 비판적 평가에서 전문가 수준의 성능을 달성했음을 보여주는 연구 결과가 발표되었습니다. 연구진은 MMTV-LV와 유방암에 초점을 맞춘 24편의 논문 데이터셋을 사용하여 도메인 전문가들과 함께 Gemini 2.5 Pro 및 Gemini 2.5 Flash 모델과 함께 이러한 모델들을 벤치마킹했습니다.
- 평가는 MCQ, 리커트 척도, 자유 응답 등 다양한 질문 유형에 걸쳐 77개 항목으로 구성된 구조화된 템플릿을 사용했습니다.
- GPT-5와 GPT-5 Nano는 인간 전문가와 구별할 수 없는 점수 분포를 보인 반면, Gemini 모델들은 기준 적용에서 현저히 관대했습니다.
- 모든 모델에서 환각(Hallucination)은 드물었지만, 전체 텍스트 내 방법론적 평가 및 모순 식별은 지속적인 취약점으로 남았습니다.
이 결과는 LLM을 자동화된 체계적 증거 합성에 활용할 수 있음을 지지하지만, 복잡한 방법론적 작업에 대해서는 추가적인 보완이 필요합니다.