⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.
라이선스: OpenReview 공개(오픈액세스)
Essence
Figure 1. Six-phase co-scientist pipeline: Phase 1 driver mining; Phase 2 causal discovery with edge-vote consensus and
LLM co-scientist 파이프라인을 통해 DAG를 도출하고 scenario-conditioned sample pool을 구축하여 LLM prior를 얻은 뒤, 이를 model-predictive control(MPC)에 결합해 zero-current-data 상황에서 전염병 통제(NPI lever 조정)에 활용하는 방법을 제안하고 Uniform 및 literature prior와 비교 평가한다.
Motivation
Known: 기존 연구들은 LLM이 causal graph의 edge prior나 구조방정식(SCM)을 제안할 수 있음을 보였고, AI co-scientist 시스템은 연구 워크플로우 일부를 자동화하며, 전염병 MPC/forecasting 연구는 주로 고정된 compartmental 구조 하에서 파라미터를 온라인으로 추정한다.
Gap: LLM이 제안하는 prior 내용이 실제 closed-loop 의사결정에 어떻게, 어떤 부분이 전이되는지, 그리고 샘플을 어떻게 소비해야 하는지가 불분명했으며, 기존 방법 중 어느 것도 LLM-elicited DAG 구성, 구조방정식 지정, surrogate distillation, closed-loop MPC, human review gate, epidemic 평가를 하나의 co-scientist 파이프라인에 결합하지 않았다.
Why: 데이터가 전혀 없는 새로운 전염병 규모(zero-current-data) 상황에서 literature prior가 커버하지 못하는 disrupted regime까지 포함한 scenario 커버리지를 제공함으로써, LLM이 고위험(high-stakes) 통제 문제에서 견고한 의사결정을 돕는 보조 도구로 기능할 수 있는지 규명하는 것은 실제 방역 정책 설계에 중요한 함의를 갖는다.
Approach: DAG drafting, human-curated consensus, scenario-conditioned component sampling, structural-equation fitting, surrogate distillation, prior-regularized MPC로 이어지는 6단계 auditable co-scientist 파이프라인을 구축하고, 이를 결정론적 SIQR compartmental epidemic model 벤치마크(5개 NPI lever)에 적용하여 Uniform-prior MPC 및 literature prior와 비교한다.
Achievement
Figure 4.
Open-loop 성능 개선: LLM prior 모드가 content-free Beta(1,1) Uniform baseline 대비 누적 감염을 25.8% 감소시켰으나, literature prior 모드는 91.3% 감소로 더 우수했다.
MPC 내 정량적 비교: Uniform Beta 정규화항을 LLM prior로 대체 시 누적 감염이 인구 1,000명당 382.18에서 313.66으로 개선되었으나, literature prior는 40.49까지 도달해 LLM prior의 calibration이 상대적으로 떨어짐을 보였다.
Scenario-ensemble 방식의 우월성: 동일한 LLM sample pool을 단일 point prior로 collapse하지 않고 scenario-softmin controller로 그대로 유지했을 때 140.07±99.36의 성능을 달성해, LLM 샘플은 point density보다 dispersed scenario set으로 활용될 때 더 효과적임을 입증했다.
6단계 auditable 파이프라인 제시: DAG, 샘플, surrogate weight, MPC trajectory를 각각 별도로 검사 가능한 co-scientist 프레임워크를 구축하고 human-in-the-loop edit gate를 포함시켰다.
How
Figure 2. Consensus causal DAG over infection-rate drivers produced by Phase 2 (edge-vote across K LLM-drafted DAGs, fol
Phase 1: LLM에 SIQR 관련 변수들에 대한 DAG를 온도 0.8에서 K=10개 독립 쿼리로 후보 생성
Phase 2: 후보 DAG들을 edge-frequency table로 집계하고, support≥0.5 edge는 기본 채택, 그 이하 edge는 인간 검토자의 근거 기반 승인만 채택하여 consensus DAG G* 구성
Phase 3: G*에 조건화하여 감염률 방정식 각 구성요소에 대한 structural-equation을 LLM으로 산출, 각 lever당 80개 scenario-conditioned 샘플 수집, 이를 통해 lever별 Beta(αk, βk) activation prior 및 LLM point prior 적합
Phase 4-5: LLM SCM 추론(calibration sample, monotonicity check) 후 tractable linear surrogate로 distillation하여 audit interface 구성
Phase 6: Beta-prior 정규화항을 포함한 MPC로 5차원 정규화 control ut∈[0,1]^5를 최적화하며, Uniform/LLM/literature prior 및 scenario-softmin controller(샘플 pool 전체 유지)를 비교
Originality
LLM co-scientist 개념을 causal DAG 도출부터 구조방정식 지정, surrogate distillation, closed-loop MPC, human review gate까지 하나의 phase-separated auditable 파이프라인으로 통합한 최초의 시도(Table 1의 capability matrix로 기존 연구와 차별화 제시)
LLM sample pool을 단일 point prior로 collapse하는 대신 scenario ensemble로 그대로 MPC에 노출시켜 규제 불확실성(regime uncertainty)을 명시적으로 다루는 scenario-softmin controller 설계
동일 소스로 매칭된 4가지 prior 사용 모드(Uniform form-only, LLM point prior, literature point prior, scenario-ensemble)를 비교하여 "무엇이 전이되는가"를 분리해 측정하는 실험 설계
Limitation & Further Study
단일 deterministic SIQR compartmental model 벤치마크와 5개 NPI lever에 국한되어 실제 역학 데이터나 stochastic/실측 환경에서의 일반화가 검증되지 않음
zero-current-data 세팅만을 다루며, 실제 관측치로 posterior를 업데이트하고 그 불확실성을 MPC에 전파하는 것은 향후 과제로 남김(저자도 명시)
LLM prior가 literature prior보다 calibration이 떨어지는 원인(프롬프트 설계, LLM의 지식 한계 등)에 대한 심층 분석이 부족
consensus DAG 구성 시 human reviewer의 주관적 판단에 의존하는 부분이 있어 재현성 및 확장성에 제약 가능
후속 연구로 실제 관측 데이터 기반 posterior update와 posterior uncertainty의 MPC 전파(robust/stochastic MPC) 결합이 필요
총평: LLM 기반 prior elicitation을 causal discovery부터 closed-loop control까지 통합한 auditable 파이프라인을 제시하고, scenario ensemble 형태로 소비하는 것이 point prior보다 유리함을 보인 흥미로운 workshop 논문이나, 단일 synthetic benchmark에 국한된 초기 단계 결과로 실제 검증과 posterior update 결합이 향후 과제로 남아있다.
기반 연구SPECTER2 유사도 0.91로 Computational Molecular Design와 AI-Driven Drug and Materials Discovery가 맞닿아, 'Latent-Y: A Lab-Validated Autonomous Agent for De Novo Antibody Design'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.