미생물 발암에 대한 체계적 증거 합성을 대상으로 대규모 언어 모델을 벤치마킹한 연구 결과, GPT-5와 GPT-5 Nano가 도메인 전문가와 구별되지 않는 성능을 보였다고 밝혔다. 연구진은 Gemini 2.5 Pro, Gemini 2.5 Flash, GPT-5, GPT-5 Nano를 여러 질문 유형에 걸쳐 77개 항목으로 구성된 구조화된 템플릿을 사용하여 24편의 연구 논문에 대해 평가했다.
- LLM의 응답은 MCQ, 리커트 척도, 다중 선택, 자유 서술 형식을 포함한 모든 질문 유형에서 전문가와 매우 밀접하게 일치했다.
- GPT-5와 GPT-5 Nano는 인간 전문가와 통계적으로 구별되지 않는 점수 분포를 달성했다.
- Gemini 모델들은 유사한 행동을 보였지만 미생물 발암 기준을 적용하는 데 있어 현저히 관대했다.
- 환각은 드물었지만, 방법론적 평가와 모순 식별은 모든 모델에 대해 지속적인 취약점으로 남았다.
이 결과는 미생물-암 페어를 식별하기 위해 LLM을 자동화된 체계적 증거 합성에 사용하는 것을 지지하지만, 복잡한 전체 텍스트 분석 작업에는 추가적인 강화가 필요하다.