연구자들은 ClinFusion을 소개했습니다. 이는 2D와 3D 의료 영상 이해를 통합하여 임상 현장에 AI를 배포하는 과제를 해결하도록 설계된 비전 중심 멀티모달 대규모 언어 모델입니다. 이 시스템은 Cascade Spatial-Aware Locality Fusion 연산자를 갖춘 구성적 캐스케이디드 비전 인코더를 특징으로 하며, MedIF-Bench와 관심 영역 기반 지표로 구성된 새로운 평가 프레임워크를 포함합니다.

  • ClinFusion은 Hulu-Med 및 Lingshu와 같은 오픈소스 모델을 능가하며 24개 벤치마크 중 20개에서 새로운 최첨단 성능을 달성했습니다.
  • 16개 벤치마크 중 13개에서 GPT-5.2 및 Gemini-3-Flash와 같은 독점 모델보다 우수한 멀티모달 능력을 입증했습니다.
  • 이 모델은 검색 증강 및 도구 지원 임상 워크플로우를 위한 에이전트 도구 사용을 지원합니다.
  • 면허를 갖춘 영상의학과 전문의들이 수행한 맹검 평가는 ClinFusion이 가장 높은 순위의 보고서를 생성함을 확인했습니다.
  • 제안된 RoI 기반 지표는 자동 평가 지표 중 전문가 판단과 가장 강한 상관관계를 보입니다.

저자들은 이것이 임상적으로 정렬되고 사실성 중심의 평가 방법을 제공하며, 모델의 출력이 영상의학과 전문가의 판단과 밀접하게 일치한다는 것을 검증했기 때문에 이를 중요하게 여깁니다.