Causal AI Scientist: Towards End-to-End Causal Inference with Large Language Models
저자: Sawal Acharya, Rahul Babu Shrestha, Jacob T. Emmerson, Vishal Verma, Devansh Bhardwaj, Samuel Simko, Punya Syon Pandey, Anahita Haghighat, Yongjin Yang, Dominik Janzing, Mrinmaya Sachan, Bernhard Schölkopf, Zhijing Jin | 날짜: 2026 | URL: https://openreview.net/forum?id=rIAuqhy6S0📄 PDF
⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.
라이선스: OpenReview 공개(오픈액세스)
Essence
Figure 1. CAIS workflow. The user provides an input dataset (CSV file), its description, and an associated causal query.
CAIS는 자연어 쿼리와 표 형식 데이터셋으로부터 LLM이 구조화된 결정 트리를 탐색하여 인과추론 방법을 자동 선택하고, 검증 피드백 루프로 가정을 재확인·자가교정한 뒤 최종 효과를 추정하는 end-to-end 에이전트 프레임워크이다.
Motivation
Known: 기존에도 Causal-Copilot, Causal Agent, CMA 등 인과 발견(causal discovery) 중심의 agentic framework와, Econometrics AI Agent, LLM4Causal, CausalFM 등 potential outcomes 기반의 부분적 자동화 도구들이 존재해왔다.
Gap: 기존 도구들은 사용자가 방법이나 변수를 수동으로 지정해야 하거나, 지원하는 기법이 제한적이고(예: DiD, RDD 미지원), 실제 데이터에 대한 검증이 부족하여 자연어 쿼리로부터 엄밀한 인과 추정까지 이어지는 진정한 end-to-end 범용 도구가 부재하다.
Why: 전문적인 방법론 지식 없이도 자연어 질의만으로 신뢰 가능한 인과추론을 수행할 수 있게 함으로써, 사회과학·공공보건·생의학 등 다양한 분야의 실증 연구자들이 전문가 수준의 인과분석에 접근할 수 있는 민주화 효과를 기대할 수 있다.
Approach: CAIS는 데이터 전처리·쿼리 분해, 규칙 기반 결정 트리를 통한 방법 선택, 가정 검증 및 피드백 루프, 방법 실행 및 해석의 4단계로 구성된 파이프라인에서 LLM 추론과 인과추론 원칙을 결합한다.
Achievement
Figure 3. Comparison of the workflows on CAIS with other agents for causal effect estimation, including Econometrics AI
CAIS 프레임워크 제안: 자연어 쿼리, 데이터셋, 데이터 설명만을 입력으로 받아 potential outcomes framework 기반의 인과추론을 처음부터 끝까지 자동 수행하는 범용 에이전트를 구현했다.
결정 트리 기반 방법 선택: LLM을 도메인 전문가로 활용해 무작위 실험 여부, 도구변수 존재 여부 등 데이터 특성을 평가하고, 해석 가능한 단계별 결정 트리를 통해 DiD, RDD 등 다양한 방법을 선택하도록 했다.
검증 피드백 루프: 선택된 방법의 표준 가정(예: parallel trends)을 사후 진단(LLM-as-a-judge 및 empirical diagnostics)으로 검증하고, 위반 시 Stage 2로 되돌아가 대안 방법을 재탐색하는 self-correction 메커니즘을 도입했다.
CauSciBench에서의 성능 우위: QRData, 실제 논문 기반 사례, synthetic 데이터로 구성된 CauSciBench의 세 서브셋에서, GPT-4o(51.61%)와 GPT-4o-mini(34.84%) 등 여러 모델 패밀리에 걸쳐 ReAct, PoT, Veridical Data Science 프롬프팅 등 베이스라인 대비 평균적으로 가장 우수한 방법 선택 및 효과 정확도를 달성했다.
How
Figure 2. Decision-tree that guides method selection in CAIS. We prompt an LLM to generate responses to queries correspo
Stage 1: 데이터셋과 메타데이터를 분석해 treatment, outcome, covariate, instrument, temporal 변수 등 핵심 구성요소를 LLM으로 식별
Stage 2: 무작위 실험 여부, 시간적 정보 존재 여부, 후보 도구변수 존재 여부 등을 평가하는 규칙 기반 decision tree를 통해 DiD, RDD 등 candidate method 선택
Stage 3: 선택된 방법의 표준 식별 가정(예: parallel trends, no anticipatory effects)에 대해 LLM-as-a-judge의 tausibility reasoning과 empirical diagnostics를 결합해 검증하고, 실패 시 Stage 2로 피드백 루프를 통해 재선택
Stage 4: 사전 정의된 code template으로 최종 방법을 실행하고 effect estimate, 신뢰구간, p-value를 자연어로 해석하여 반환
CauSciBench(QRData, 실제 논문 기반, synthetic 데이터셋)에서 ReAct, Program of Thoughts, Veridical Data Science 프롬프트를 baseline으로 비교 평가하고, decision tree 및 validation feedback loop에 대한 ablation study 수행
Originality
기존 causal discovery 중심 에이전트(Causal-Copilot, CMA, Causal Agent)와 달리 potential outcomes framework 기반의 DiD, RDD 등 quasi-experimental 방법까지 포괄하는 범용 end-to-end 프레임워크를 제시
방법 선택을 해석 가능한 규칙 기반 decision tree로 구조화하여 LLM 추론의 블랙박스성을 완화하고 근거를 명시적으로 제공
사후 실증적 진단(post-selection empirical diagnostics)과 self-correction을 위한 validation feedback loop를 통합하여 신뢰성을 강화한 최초의 시도로 제시
Limitation & Further Study
방법 선택이 사전에 설계된 규칙 기반 decision tree에 의존하므로, 트리에 명시되지 않은 새로운 인과추론 방법이나 복잡한 다중 처리(multiple treatment) 상황으로 확장하기 어려울 수 있음
가정 검증이 LLM-as-a-judge의 plausibility reasoning에 상당 부분 의존하여, LLM의 판단 오류나 편향이 최종 방법 선택 및 해석에 영향을 줄 위험이 존재
평가가 CauSciBench라는 특정 벤치마크에 한정되어 있어, 더 다양한 도메인·데이터 규모·잡음 수준에서의 일반화 가능성에 대한 추가 검증이 필요
특정 frontier 모델은 대안적 프롬프팅으로도 우수한 성능을 보인다는 결과가 있어, CAIS의 상대적 이점이 모델에 따라 제한적일 수 있음에 대한 후속 분석이 필요
총평: 인과추론 자동화라는 실용적으로 중요한 문제를 해석 가능한 decision tree와 검증 피드백 루프로 체계적으로 해결한 견실한 연구이며, CauSciBench에서의 실증적 우위를 통해 실질적 기여를 입증했으나 규칙 기반 트리의 확장성과 LLM 판단 의존성에 대한 추가 검증이 필요하다.
기반 연구SPECTER2 유사도 0.94로 LLM Reasoning and Safety Benchmarks와 Agentic AI for Scientific Automation가 맞닿아, 'Kosmos: An AI Scientist for Autonomous Discovery'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.95로 LLM Reasoning and Safety Benchmarks와 Agentic AI for Scientific Automation가 맞닿아, 'Heterogeneous Scientific Foundation Model Collaboration'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.