IRIS: An Agentic Multi-Phase Framework for Automated Scientific Literature Review

저자: Sergey Kolchenko, Mahdi Zamanighomi, Amir Bayegan | 날짜: 2026 | URL: https://openreview.net/forum?id=9JfFiOrfrp 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. Three-phase architecture of IRIS. Arrows within phases

IRIS는 과학 문헌 리뷰를 자동화하는 agentic framework로, 반복적 계획, 병렬 섹션별 연구·작성, 최종 보고서 컴파일의 3단계를 directed state graph로 orchestration하며, reflective research expansion과 critic-guided refinement라는 두 핵심 메커니즘을 통해 PubMed와 ArXiv만으로도 상용 deep research 시스템들을 능가하는 성능을 보인다.

Motivation

Achievement

  1. DeepResearch-Bench 최고 성능: 50개 PhD 수준 영어 연구 과제에서 RACE overall score 53.46을 달성하여 Gemini 2.5 Pro Deep Research(48.88), OpenAI Deep Research(46.98)를 포함한 보고된 모든 상용 시스템을 능가했다.
  2. 제한된 소스에서의 우위: PubMed와 ArXiv에만 국한되고 open-web retrieval이 없음에도 RACE의 4개 dimension(comprehensiveness, insight, instruction following, readability) 모두에서 1위를 차지했다.
  3. claim-level citation tracking: 모든 사실 주장(factual assertion)을 구체적인 출처 구절(source passage)로 매핑하는 provenance 체계를 구현했다.

How

Figure 1

Figure 1. Three-phase architecture of IRIS. Arrows within phases

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: reflective expansion과 critic-guided refinement라는 두 메커니즘을 통해 제한된 curated corpus만으로도 상용 deep research 시스템을 능가하는 실용적이고 잘 설계된 agentic framework를 제시했으나, citation factuality에 대한 정량 검증과 세부 ablation이 보강되면 더욱 설득력이 높아질 것이다.

같이 보면 좋은 논문

기반 연구LLM 기반 연구 자동화 기법을 실제 연구 문제에 적용한 사례이다.
기반 연구SPECTER2 유사도 0.95로 LLM Reasoning and Safety Benchmarks와 Agentic AI for Scientific Automation가 맞닿아, 'Biodsa-1k: Benchmarking data science agents for biomedical research'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.95로 LLM Reasoning and Safety Benchmarks와 Scientific Information Extraction and QA가 맞닿아, 'Explainable biomedical claim verification with large language models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.95로 LLM Reasoning and Safety Benchmarks와 AI-Assisted Academic Scholarly Communication가 맞닿아, 'Frame: Feedback-refined agent methodology for enhancing medical research insights'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근피드백 기반 반복 개선 방법론을 활용하는 유사한 에이전트 시스템을 제시한다.
기반 연구다중 단계 agentic 시스템 설계의 방법론적 토대를 공유함
기반 연구혁신 지표 측정 방법론을 확장한 연구
기반 연구구조적 갭 탐지 프레임워크를 확장한 후속 연구로 추정됨
기반 연구연구 목표 기반 검색 및 평가 방법론을 확장하여 활용한다.
기반 연구rubric 기반 self-grading 접근을 확장하여 연구 목표 평가에 활용한다.
기반 연구human-in-the-loop 에이전트 프레임워크의 확장 적용
다른 접근과학 문헌 리뷰 자동화를 다른 에이전트 오케스트레이션 방식으로 구현한다.
기반 연구임상 AI 문헌 구조화라는 실제 응용 문제에 LLM 에이전트를 적용한 사례
후속 연구reflective research expansion을 포함한 반복적 계획 구조를 확장한다.
기반 연구다단계 agentic 프레임워크 설계의 방법론적 토대를 제공한다.
기반 연구미래 논문 검증 방식을 실제 과학 도메인에 적용한다.
기반 연구멀티에이전트 지식그래프 구축 및 추론 프레임워크를 확장하는 연구이다.
다른 접근다중 에이전트 협력 기반 연구 자동화라는 동일 문제를 다른 아키텍처로 접근한다.
다른 접근LLM 기반 생의학 주장 검증 접근법의 대안적 방법을 제시한다.
다른 접근체계적 문헌고찰을 위한 AI 도구 평가라는 유사한 문제를 다룬다.
다른 접근human-in-the-loop을 포함한 다중 에이전트 연구 파이프라인이라는 유사한 설계를 취한다.
다른 접근LLM 기반 multi-agent 프레임워크 설계라는 공통 방법론을 공유한다.
다른 접근AI 연구 자동화 시스템 신뢰성 평가에 대한 다른 접근
다른 접근연구 과정의 구조화된 표현이라는 유사한 방법론적 기반을 공유함.
다른 접근문헌 리뷰 자동화를 위한 다른 agentic multi-phase 접근법으로 검색 의도 반영과 검증 메커니즘을 갖춘 대안적 시스템이다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드