Исследователи представляют ClinFusion, мультимодальную большую языковую модель, ориентированную на зрение и предназначенную для комплексного медицинского понимания, которая объединяет анализ 2D и нативных 3D изображений. Система использует композиционный каскадный визуальный энкодер с оператором Cascade Spatial-Aware Locality Fusion для решения проблем гетерогенной медицинской визуализации.
- ClinFusion превосходит ведущие модели с открытым исходным кодом, такие как Hulu-Med и Lingshu, в 20 из 24 бенчмарков, включая визуальное ответствование на вопросы и генерацию отчетов.
- Она демонстрирует мультимодальные возможности, превосходящие проприетарные модели, такие как GPT-5.2 и Gemini-3-Flash, в 13 из 16 бенчмарков.
- Авторы предлагают MedIF-Bench для оценки следования инструкциям и метод, основанный на области интереса (RoI), для оценки фактологической достоверности отчетов.
- Слепая оценка сертифицированными врачами-радиологами подтвердила, что ClinFusion генерирует отчеты с наивысшим рейтингом, что подтверждает корреляцию нового метрического показателя RoI-grounded с мнением экспертов.
ClinFusion устанавливает новый рекорд в комплексных медицинских бенчмарках и может быть дополнена использованием агентов для извлечения инструментов в клинических рабочих процессах с расширенным поиском.