Исследователи представляют ClinFusion, мультимодальную большую языковую модель с акцентом на зрение, разработанную для решения проблем внедрения ИИ в клиническую практику путем объединения понимания 2D и 3D медицинских изображений. Система включает композиционный каскадный визуальный энкодер с оператором каскадного пространственно-ориентированного локального слияния и новый фреймворк оценки, включающий MedIF-Bench и метрики, основанные на области интереса.
- ClinFusion устанавливает новый уровень state-of-the-art в 20 из 24 бенчмарков, превосходя открытые модели, такие как Hulu-Med и Lingshu.
- Она демонстрирует мультимодальные возможности, превосходящие проприетарные модели GPT-5.2 и Gemini-3-Flash в 13 из 16 бенчмарков.
- Модель поддерживает использование агентов для инструментов ретrieve-augmented и tool-assisted клинических рабочих процессов.
- Слепые оценки сертифицированными врачами-радиологами подтверждают, что ClinFusion генерирует отчеты с наивысшим рейтингом.
- Предложенная метрика RoI-grounded показывает самую сильную корреляцию с мнением экспертов среди автоматических метрик оценки.
Авторы считают это значимым, поскольку это обеспечивает клинически согласованный метод оценки, ориентированный на фактологичность, и подтверждает, что вывод их модели тесно соответствует мнению экспертов-радиологов.