AgentSLR: Automating Systematic Literature Reviews in Epidemiology with Agentic AI
저자: Shreyansh Padarha, Ryan Othniel Kearns, Tristan Myles Naidoo, Lingyi Yang, Łukasz Borchmann, Piotr Blaszczyk, Christian Morgenstern, Ruth McCabe, Sangeeta Bhatia, Philip Torr, Jakob Nicolaus Foerster, Scott A. Hale, Thomas Rawson, Anne Cori, Elizaveta Semenova, Adam Mahdi | 날짜: 2026 | URL: https://openreview.net/forum?id=qrR2mrP0TH📄 PDF
⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.
라이선스: OpenReview 공개(오픈액세스)
Essence
Figure 1. AgentSLR for assisting and evaluating large language models on systematic literature reviews in epidemiology (
AgentSLR은 article retrieval부터 screening, data extraction, report synthesis까지 systematic literature review(SLR)의 전체 워크플로우를 agentic LLM/LRM 파이프라인으로 자동화하는 open-source harness이며, 9개 WHO priority pathogen에 대한 역학 SLR에서 인간 전문가 수준의 성능을 유지하면서 리뷰 시간을 약 7주에서 20시간으로 58배 단축시킴을 보인다.
Motivation
Known: LLM은 title/abstract screening 등 SLR의 일부 단계에서 인간의 작업 부담을 줄일 수 있음이 이미 보고되었으며, 과학 논문 요약 시 conclusion 일반화 등 특정 실패 양상도 문헌에서 확인된 바 있다.
Gap: 기존 연구는 주로 screening과 같은 단일 단계에 초점을 맞췄을 뿐, retrieval-screening-extraction-synthesis로 이어지는 전체 SLR 워크플로우를 하나의 agentic 시스템으로 자동화하고 실제 전문가 라벨과 대규모로 검증한 사례는 부재했다.
Why: SLR은 근거 기반 정책 수립에 필수적이지만 평균 6-7주, $141,000의 비용이 드는 병목 작업이므로, 이를 신뢰성 있게 자동화할 수 있다면 역학을 포함한 전문 과학 분야에서 근거 종합(evidence synthesis) 속도를 획기적으로 높일 수 있다.
Approach: 본 논문은 article search/retrieval, title-abstract screening, PDF-to-Markdown 변환, full-text screening, structured data extraction, report generation의 6단계로 구성된 AgentSLR harness를 제안하고, WHO 9개 priority pathogen에 대한 PERG(Pathogen Epidemiology Review Group)의 expert-curated SLR 라벨과 비교하여 검증한다.
Achievement
Figure 5. Model ablation results with AgentSLR across all pipeline stages. Averages are computed over the pathogens eval
전체 워크플로우 자동화: retrieval부터 report synthesis까지 SLR 전 과정을 커버하는 open-source agentic harness AgentSLR을 구축함.
대규모 실증 검증: 9개 WHO priority pathogen(예: Ebola, Lassa, SARS-CoV-1, Zika 등)에 대한 PERG의 expert-curated 라벨 대비 성능을 검증하여 인간 연구자와 comparable한 성능을 달성함.
획기적 속도 향상: 리뷰 소요 시간을 약 7주에서 20시간으로 58배 단축함.
모델 비교 분석: gpt-oss-120b, GPT-5.2, Kimi-K2.5, GLM-4.7, DeepSeek-V3.2 등 5개 frontier reasoning model을 파이프라인 각 단계별로 ablation하여, 성능이 모델 크기나 추론 비용보다 모델별 고유 역량(distinctive capabilities)에 좌우됨을 규명함.
실패 모드 규명: human-in-the-loop validation을 통해 주요 실패 모드를 식별함.
How
Figure 1. AgentSLR for assisting and evaluating large language models on systematic literature reviews in epidemiology (
Article Search and Retrieval: OpenAlex, PubMed, Europe PMC 3개 bibliographic database를 도메인 특화 Boolean search로 질의하고, identifier·metadata 기반 중복 제거 후 open-access 소스에서 전문(full text)을 자동 수집함.
Title and Abstract Screening: ScreenPrompt 방법론을 따라 study objectives, inclusion/exclusion criteria, chain-of-thought instructions, abstract, structured output format의 5개 요소로 프롬프트를 구성한 LRM으로 초기 스크리닝을 수행함.
PDF-to-Markdown Conversion: PDF를 페이지 단위 고해상도 이미지로 렌더링한 후 OCR 모델로 처리하여 수식(LaTeX)·표(HTML) 구조를 보존한 Markdown으로 변환함.
Full-text Screening: 정량적 역학 파라미터 추출 가능 여부 등 더 엄격한 기준으로 LRM 기반 재스크리닝을 수행함.
Data Extraction: presence flagging 후 parameter/model/outbreak-specific tool call과 schema validation을 활용한 multi-stage 구조화 추출(population tagging 포함)을 수행함.
Report Generation: descriptive statistics 계산·시각화 후 LRM이 초안 서사를 생성하고, rubric 기반 critique와 evidence grounding을 반복하는 self-refinement로 보고서를 완성함.
평가: PERG의 epireview 및 priority-pathogen R package 데이터를 참조 라벨로 사용하고, 폐쇄형 접근(closed-access) 논문 1,004건과의 matched comparison으로 open-access 서브셋의 대표성을 검증함.
Originality
SLR의 개별 단계(주로 screening)에 국한된 기존 연구와 달리, retrieval-screening-extraction-synthesis 전체를 단일 agentic harness로 통합함.
역학(epidemiology)이라는 고위험(high-stakes) 전문 도메인에 적용하여 WHO priority pathogen이라는 실제 정책적 함의가 있는 데이터셋으로 검증함.
5개 frontier reasoning model에 대한 파이프라인 단계별 ablation을 통해 모델 크기·비용과 성능 간 관계가 아닌 모델별 고유 역량이 성능을 좌우한다는 새로운 통찰을 제시함.
Limitation & Further Study
평가 대상 데이터가 전체 PERG corpus 중 open-access로 확보 가능한 약 26.2%에 국한되어, 폐쇄형 논문에 대한 일반화 가능성은 matched comparison 결과에 의존적임.
Marburg, MERS, Nipah 등 일부 병원체는 데이터 불일치 또는 PERG 추출 단계 미완료로 인해 평가에서 제외되어 전체 9개 병원체에 대한 완전한 검증이 이루어지지 않음.
발췌된 본문만으로는 report generation 단계의 정성적 품질(narrative synthesis의 정확성)에 대한 정량 평가 방법이 충분히 드러나지 않아, 향후 다른 과학 도메인(역학 외)으로의 일반화 검증이 필요함.
human-in-the-loop을 통한 실패 모드 식별이 이루어졌으나, 이러한 실패가 실제 정책 결정에 미치는 영향에 대한 후속 연구가 필요함.
총평: SLR 전 과정을 아우르는 최초 수준의 통합 agentic 자동화 시스템을 고위험 실전 도메인(역학)에서 대규모로 검증했다는 점에서 실용적 임팩트가 크며, 모델 선택에 대한 실증적 통찰도 유용하다. 다만 open-access 데이터 편중과 일부 병원체 제외로 인한 검증 범위의 제약은 향후 보완이 필요하다.
기반 연구SPECTER2 유사도 0.95로 Biomedical AI Knowledge Systems와 AI-Driven Drug and Materials Discovery가 맞닿아, 'Bio-SIEVE: Exploring Instruction Tuning Large Language Models for Systematic Review Automation'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.94로 Biomedical AI Knowledge Systems와 AI-Assisted Academic Scholarly Communication가 맞닿아, 'Automated review generation method based on large language models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.