From Conflict to Consensus: Boosting Medical Reasoning via Multi-Round Agentic RAG

저자: Wenhao Wu, Zhentao Tang, Yafu Li, Shixiong Kai, Mingxuan Yuan, Zhenhong Sun, Chunlin Chen, Zhi Wang | 날짜: 2026 | URL: https://openreview.net/forum?id=S7lpdz7NAW 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. MA-RAG’s agentic workflow that iteratively refines con-

의료 질의응답에서 LLM의 환각과 지식 노후화 문제를 해결하기 위해, 후보 응답들 간의 의미적 conflict를 신호로 활용하여 외부 근거 검색과 내부 reasoning history를 반복적으로 갱신하는 multi-round agentic RAG 프레임워크인 MA-RAG를 제안한다.

Motivation

Achievement

Figure 3

Figure 3. Performance comparison between MA-RAG and the

  1. 일관된 성능 향상: 7개 의료 Q&A 벤치마크에서 MA-RAG는 competitive한 inference-time scaling 및 RAG baseline들을 지속적으로 능가했다.
  2. 큰 폭의 정확도 개선: backbone model 대비 평균 정확도 +6.8점의 상당한 성능 향상을 달성했다.
  3. 어려운 문제에서의 두드러진 이득: MedXpertQA와 같이 information-dense query와 정교한 reasoning이 필요한 어려운 벤치마크에서 baseline 대비 37%의 상대적 개선을 보여, 복잡한 의료 추론에서의 강점을 입증했다.
  4. 강건한 multi-round refinement: 종합 분석과 사례 연구를 통해 MA-RAG가 다중 라운드 refinement 과정에서 안정적인 성능을 보이며 test-time scaling을 효과적으로 유도함을 확인했다.

How

Figure 2

Figure 2. Overall pipeline of MA-RAG (Multi-round Agentic RAG) for complex medical reasoning. At each round t of the age

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: token-level 신호의 한계를 지적하고 semantic conflict를 활용한 multi-round agentic RAG라는 참신한 접근으로 의료 추론 성능을 크게 개선한 견고한 연구이며, 세부 알고리즘의 재현성과 계산 비용 분석이 보강되면 더욱 완성도 높은 기여가 될 것이다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.91로 Clinical Time-Series Modeling와 Agentic AI for Scientific Automation가 맞닿아, 'A survey of llm-based agents in medicine: How far are we from baymax? arXiv preprint arXiv:2502.11211, 2025.'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.91로 Clinical Time-Series Modeling와 Agentic AI for Scientific Automation가 맞닿아, 'Biodsa-1k: Benchmarking data science agents for biomedical research'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.92로 Clinical Time-Series Modeling와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'FRAG: A Flexible Modular Framework for Retrieval-Augmented Generation based on Knowledge Graphs'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근검색증강생성의 유연성 개선을 위한 유사한 프레임워크를 다룬다.
기반 연구의료 지식 유형별 처리라는 아이디어를 확장하여 유사한 지식 카테고리화 프레임워크를 제시한다.
기반 연구의료 RAG 시스템의 이론적 기초 제공
기반 연구pairwise comparison 기반 집계 방법을 확장한 연구
다른 접근지식 노후화 문제 해결의 다른 방법론
다른 접근의료 추론을 위한 다른 multi-agent 접근법
다른 접근의료 QA에서의 환각 문제 해결에 대한 다른 접근법
후속 연구의미적 conflict 활용 추론의 확장 연구
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드