저자: Bowen Shi, Weiwei Cao, Ruifeng Yuan, Wanxing Chang, Wenrui Dai, Hongkai Xiong, Ling Zhang, Jianpeng Zhang | 날짜: 2026 | URL: https://openreview.net/forum?id=LcSPuepCDU 📄 PDF
Essence
Figure 1. The proposed disease-centric vision–language pretraining framework. (a) CNN–ViT hybrid encoder replaces patch
3D CT 영상과 방사선 보고서를 이용한 vision-language pretraining에서, CNN-ViT hybrid encoder와 disease-level contrastive learning, diagnosis-aware prompt strategy를 결합해 질환 단위의 세밀한 정렬을 달성한 프레임워크를 제안한다.
Evaluation
Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5
총평: 3D CT VLP에서 고질적이었던 backbone 비효율성과 조악한 semantic alignment 문제를 hybrid encoder와 disease-level contrastive learning으로 동시에 해결한 실용적이고 완성도 높은 연구로, 여러 benchmark에서 확실한 성능 향상을 보여준다.
같이 보면 좋은 논문
기반 연구SPECTER2 유사도 0.91로 Multimodal Biomedical Data Fusion와 Agentic AI for Scientific Automation가 맞닿아, 'Aiscivision: A framework for specializing large multimodal models in scientific image classification'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.92로 Multimodal Biomedical Data Fusion와 Scientific Information Extraction and QA가 맞닿아, 'ClinicalGPT-R1: Pushing reasoning capability of generalist disease diagnosis with large language model'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구멀티모달 의료 진단 프레임워크를 확장하여 유사한 MoE 기반 융합 구조를 다룸
기반 연구질병 간 comorbidity 관계를 활용한 진단 모델을 확장한다.
기반 연구foundation model의 latent embedding 해석성을 다른 의료 영상 도메인에 적용
기반 연구뇌 연결망 그래프 표현학습을 실제 신경과학 응용에 적용한다.
기반 연구sparse field 기반 발현 추론을 확장한다.
기반 연구신체 구조 인식 기반 VLM 평가를 확장한 연구
기반 연구joint-individual representation learning 개념을 확장하여 적응형 결정 융합을 적용한 후속 연구이다.
기반 연구SPECTER2 유사도 0.91 기준으로 'Disease-Centric Vision-Language Pretraining with Hybrid Visual Encoding for 3D Computed Tomography'의 AI4S 방법론을 'S1-MMAlign: A Large-Scale, Multi-Disciplinary Dataset for Scientific Figure-Text Understanding'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
기반 연구SPECTER2 유사도 0.92로 Multimodal Biomedical Data Fusion와 AI-Driven Drug and Materials Discovery가 맞닿아, 'Contrastive learning for antibody-antigen sequence-to-specificity prediction'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근의료 영상 처리에서 모달리티별 적응 방법을 제안하는 유사 연구이다.
다른 접근농업 도메인 VLM 진단 시스템의 대안적 아키텍처를 제시한다.
다른 접근의료 영상-텍스트 vision-language pretraining의 다른 아키텍처 설계이다.
후속 연구multi-modal fragment 표현 학습의 기초 방법론을 제공한다.
다른 접근생존 구간 추정을 위한 다른 프로토타입 학습 방식을 제안한다.
다른 접근파라미터 업데이트 없는 test-time 적응이라는 동일한 문제를 다룬다.
다른 접근이종 모델 간 지식 증류를 위한 유사한 프레임워크를 다른 매칭 기법으로 구현함
다른 접근3D 의료 영상 기반 유사한 pretraining 접근법이다.
후속 연구의료 영상 생성 및 이해를 위한 기반 멀티모달 학습 기법을 제공한다.
후속 연구disease-level contrastive learning을 확장 적용한다.