연구자들은 ClinFusion을 소개했는데, 이는 2D와 네이티브 3D 이미지 분석을 통합하여 포괄적인 의료 이해를 위해 설계된 비전 중심 멀티모달 대규모 언어 모델입니다. 이 시스템은 이질적인 의료 영상 분석의 과제를 해결하기 위해 Cascade Spatial-Aware Locality Fusion 연산자가 포함된 구성적 캐스케이드 비전 인코더를 활용합니다.
- ClinFusion은 시각적 질문 답변 및 보고서 생성을 포함한 24개 벤치마크 중 20개에서 Hulu-Med와 Lingshu와 같은 주요 오픈소스 모델을 능가합니다.
- GPT-5.2와 Gemini-3-Flash와 같은 독점 모델보다 우수한 멀티모달 능력을 16개 벤치마크 중 13개에서 입증했습니다.
- 저자들은 지시 따르기 평가를 위해 MedIF-Bench를 제안하고, 사실성 기반 보고서 평가를 위한 관심 영역 기반 방법을 제시했습니다.
- 자격증을 갖춘 영상의학과 전문의들의 맹검 평가는 ClinFusion이 가장 높은 순위의 보고서를 생성했으며, 이는 새로운 RoI 기반 지표가 전문가 판단과 상관관계가 있음을 검증했다고 확인했습니다.
ClinFusion은 포괄적인 의료 벤치마크 전반에 걸쳐 새로운 최첨단 기록을 수립했으며, 검색 증강 임상 워크플로우를 위해 에이전트 도구 사용으로 확장할 수 있습니다.