MedScope: Incentivizing "Think with Videos" for Clinical Reasoning via Coarse-to-Fine Tool Calling

저자: Wenjie Li, Yujie Zhang, Haoran Sun, Xingqi He, Hongcheng Gao, Chenglong Ma, Ming Hu, Guankun Wang, Shiyi Yao, Renhao Yang, Hongliang Ren, Lei Wang, Junjun He, Yankai Jiang | 날짜: 2026 | URL: https://openreview.net/forum?id=OOyPj8hdiM 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 2

Figure 2. Comparison between textual CoT and visual CoT for evidence-grounded clinical video reasoning. Left: textual Co

MedScope는 장시간 임상 비디오(수술/내시경) 이해를 위해 텍스트 위주의 일회성 CoT 대신, coarse-to-fine tool calling을 통해 반복적으로 증거를 탐색·검증하는 visual Chain-of-Thought(VCoT) 패러다임을 제안하고, 이를 ClinVideoSuite 데이터셋과 GA-GRPO 강화학습으로 학습시킨 tool-using video LMM이다.

Motivation

Achievement

Figure 1

Figure 1. Performance comparison on full and fine-grained

  1. MedScope 모델 제안: 3단계(clinical reasoning warm-up, visual CoT cold-start SFT, GA-GRPO 강화학습) 파이프라인을 통해 doctor-like coarse-to-fine 검증 행동을 이끌어내는 tool-using clinical video reasoning model을 구축했다.
  2. ClinVideoSuite 데이터 스위트 구축: ClinVideo-QA-254K, ClinVideo-VCoT-34K, caption/CoT 서브셋 및 traceable evidence를 갖춘 fine-grained 벤치마크 ClinVideo-Eval을 포함하는 evidence-centric 대규모 데이터 자원을 구축했다.
  3. GA-GRPO 제안: grounding-aligned reward와 evidence-weighted advantage를 활용하여 tool 사용을 직접 강화하고 다양한 비디오 조건에서 안정적인 학습을 가능하게 하는 agentic RL 기법을 제안했다.
  4. SOTA 성능 달성: full 및 fine-grained video understanding 벤치마크(SVU-31K, ClinVideo-Eval 등)에서 in-domain 및 out-of-domain 평가 모두에서 오픈소스 모델 중 최고 성능을 달성했다.

How

Figure 3

Figure 3. Overview of MedScope. (a) Coarse-to-fine clinical reasoning with explicit thought and tool actions that progre

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 임상 비디오 이해를 위한 tool-integrated visual CoT 패러다임과 이를 뒷받침하는 대규모 데이터 자원 및 grounding-aware 강화학습 기법을 체계적으로 결합한 의미 있는 연구로, 의료 AI 에이전트의 신뢰성 있는 근거 기반 추론 발전에 기여할 잠재력이 크다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.92로 Clinical Time-Series Modeling와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Iterative self-incentivization empowers large language models as agentic searchers'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구인간-AI 협업 진단 시스템을 실제 임상 문제에 적용한 유사 연구이다.
후속 연구visual Chain-of-Thought를 임상 비디오에 확장 적용함
기반 연구SPECTER2 유사도 0.92로 Clinical Time-Series Modeling와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구적응적 추론 방식을 실제 의료 LLM 시스템에 적용한다.
다른 접근의료 도메인에서의 chain-of-thought 추론이라는 유사한 방법론을 다룬다.
기반 연구패치 수 및 추론 시간 절감 기법을 다른 병리 이미지 태스크에 적용한다.
기반 연구entropy regularization을 유사한 에이전트 훈련 문제에 적용한 연구이다.
다른 접근장시간 비디오 이해를 위한 다른 추론 전략을 제시한다.
기반 연구가이드라인 기반 평가를 임상 진단 등 실제 고위험 도메인에 적용한다.
다른 접근임상 영상/비디오 이해를 위한 유사한 시각적 추론 접근이다.
다른 접근Med-LVLM의 정확한 임상 추론을 위한 유사한 목표를 공유한다.
후속 연구causal reasoning 기반 해석가능성의 방법론적 기초를 제공한다.
후속 연구비디오 기반 임상 추론으로 확장된 시각적 이해 접근이다.
후속 연구의료 RAG 시스템의 이론적 기초 제공
후속 연구온디바이스 개인 데이터 처리의 기초 프레임워크를 제공한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드