Ophiuchus: Incentivizing Tool-augmented ''Think with Images'' for Joint Medical Segmentation, Understanding and Reasoning

저자: Yankai Jiang, Yujie Zhang, Peng Zhang, Wenjie Li, Yichen Li, Jintai Chen, Xiaoming Shi, Shihui Zhen | 날짜: 2026 | URL: https://openreview.net/forum?id=coJqVkqb03 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 2

Figure 2. Overview of the Ophiuchus. A versatile “think with images” framework that integrates zoom and segmentation too

의료 영상 MLLM이 텍스트 전용 CoT의 한계를 극복하기 위해, SAM2·BiomedParse·zoom-in 등 외부 도구를 추론 과정에 능동적으로 통합하는 tool-augmented "think with images" 프레임워크인 Ophiuchus를 제안하며, 3단계 학습(cold-start SFT, self-reflection fine-tuning, agentic tool RL)을 통해 VQA, detection, reasoning 기반 segmentation 전반에서 SOTA를 달성한다.

Motivation

Achievement

Figure 3

Figure 3. Performance comparison on medical Segmentation benchmarks. Colors

  1. Ophiuchus 프레임워크 제안: 도구 호출을 단순 호출이 아니라 MLLM의 grounding·reasoning과 긴밀히 결합한 tool-augmented "think with images" 패러다임으로 구현.
  2. 고품질 데이터셋 구축: grounding 및 명시적 tool-invocation trajectory 주석이 포함된 64k 규모 데이터셋 구축.
  3. 3단계 학습 전략 설계: cold-start SFT, self-reflection sampling(SRS) 기반 fine-tuning, agentic tool reinforcement learning(ATRL)을 통해 단순 모방에서 벗어나 정교한 tool-use 정책을 자율적으로 발견.
  4. 광범위한 벤치마크에서 SOTA 달성: in-domain 및 zero-shot 시나리오를 포함한 8개 벤치마크(VQA, detection, reasoning 기반 segmentation)에서 closed-source 및 open-source SOTA 모델들을 지속적으로 능가.

How

Figure 2

Figure 2. Overview of the Ophiuchus. A versatile “think with images” framework that integrates zoom and segmentation too

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 의료 영상 진단에서 텍스트 전용 추론의 한계를 명확히 지적하고, 외부 도구를 추론 루프에 긴밀히 통합하는 tool-augmented "think with images" 패러다임과 이를 위한 체계적인 3단계 학습 전략을 제시한 점에서 실용적·기술적 기여도가 높은 연구로 평가된다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.93로 Clinical Time-Series Modeling와 Scientific AI for Physics and Environment가 맞닿아, 'Can gpt-4v (ision) serve medical applications? case studies on gpt-4v for multimodal medical diagnosis'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.92로 Clinical Time-Series Modeling와 Agentic AI for Scientific Automation가 맞닿아, 'Aiscivision: A framework for specializing large multimodal models in scientific image classification'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구의료 영상 진단에 MLLM을 적용하는 유사한 응용 사례로 판단됨
기반 연구region-level visual comprehension 기법을 확장함
기반 연구반사실적 예견 기법을 확장하여 다른 질환에 적용한 연구로 보임
기반 연구해석 가능한 진단 모델을 실제 임상에 적용한 유사 연구
기반 연구gigapixel 이미지 분석의 점진적 추론 방식을 확장하여 제시
후속 연구의료 영상 reasoning에서 think-with-images 접근을 확장하여 적용함
기반 연구의료 VQA 평가를 다중 이미지 추론으로 확장
기반 연구의료 영상 진단에 증거 기반 추론을 적용한 유사 연구이다.
다른 접근의료 이미지 분석에서 도구 통합 추론이라는 유사한 문제 설정을 가짐
기반 연구의료 진단 모델의 지식 증류를 실제 임상 적용에 활용한다.
기반 연구SPECTER2 유사도 0.92로 Clinical Time-Series Modeling와 Scientific Information Extraction and QA가 맞닿아, 'Beyond Medical Diagnostics: How Medical Multimodal Large Language Models Think in Space'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근의료 영상 분야에서 유사한 tool-use 기반 추론 접근법을 제시한다.
다른 접근의료 영상 MLLM의 추론 능력 향상을 위한 유사한 tool-augmented 접근을 제시함
다른 접근의료 영상 AI 모델의 해석 가능성을 인과적 방법으로 검증하는 유사한 접근을 취한다.
다른 접근의료 영상 분할에서 해부학적 특징을 다루는 유사한 딥러닝 접근법이다.
다른 접근WSI 생존 예측 문제를 다른 프로토타입 구조로 접근한다.
다른 접근tool-augmented reasoning의 다른 구현 방식을 제시한다.
후속 연구LoRA 기반 모달리티 적응 기법의 기초가 되는 프레임워크를 제공한다.
후속 연구의료 VQA 및 진단 추론의 기초적 평가 방법 제공
후속 연구의료 VQA 평가 방법론의 기초를 제공
후속 연구불확실성 인식 기반 의료 영상 분석의 이론적 기반을 제공한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드