Causal AI Scientist: Towards End-to-End Causal Inference with Large Language Models

저자: Sawal Acharya, Rahul Babu Shrestha, Jacob T. Emmerson, Vishal Verma, Devansh Bhardwaj, Samuel Simko, Punya Syon Pandey, Anahita Haghighat, Yongjin Yang, Dominik Janzing, Mrinmaya Sachan, Bernhard Schölkopf, Zhijing Jin | 날짜: 2026 | URL: https://openreview.net/forum?id=rIAuqhy6S0 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. CAIS workflow. The user provides an input dataset (CSV file), its description, and an associated causal query.

CAIS는 자연어 쿼리와 표 형식 데이터셋으로부터 LLM이 구조화된 결정 트리를 탐색하여 인과추론 방법을 자동 선택하고, 검증 피드백 루프로 가정을 재확인·자가교정한 뒤 최종 효과를 추정하는 end-to-end 에이전트 프레임워크이다.

Motivation

Achievement

Figure 3

Figure 3. Comparison of the workflows on CAIS with other agents for causal effect estimation, including Econometrics AI

  1. CAIS 프레임워크 제안: 자연어 쿼리, 데이터셋, 데이터 설명만을 입력으로 받아 potential outcomes framework 기반의 인과추론을 처음부터 끝까지 자동 수행하는 범용 에이전트를 구현했다.
  2. 결정 트리 기반 방법 선택: LLM을 도메인 전문가로 활용해 무작위 실험 여부, 도구변수 존재 여부 등 데이터 특성을 평가하고, 해석 가능한 단계별 결정 트리를 통해 DiD, RDD 등 다양한 방법을 선택하도록 했다.
  3. 검증 피드백 루프: 선택된 방법의 표준 가정(예: parallel trends)을 사후 진단(LLM-as-a-judge 및 empirical diagnostics)으로 검증하고, 위반 시 Stage 2로 되돌아가 대안 방법을 재탐색하는 self-correction 메커니즘을 도입했다.
  4. CauSciBench에서의 성능 우위: QRData, 실제 논문 기반 사례, synthetic 데이터로 구성된 CauSciBench의 세 서브셋에서, GPT-4o(51.61%)와 GPT-4o-mini(34.84%) 등 여러 모델 패밀리에 걸쳐 ReAct, PoT, Veridical Data Science 프롬프팅 등 베이스라인 대비 평균적으로 가장 우수한 방법 선택 및 효과 정확도를 달성했다.

How

Figure 2

Figure 2. Decision-tree that guides method selection in CAIS. We prompt an LLM to generate responses to queries correspo

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 인과추론 자동화라는 실용적으로 중요한 문제를 해석 가능한 decision tree와 검증 피드백 루프로 체계적으로 해결한 견실한 연구이며, CauSciBench에서의 실증적 우위를 통해 실질적 기여를 입증했으나 규칙 기반 트리의 확장성과 LLM 판단 의존성에 대한 추가 검증이 필요하다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.94로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Towards Scientific Discovery with Generative AI: Progress, Opportunities, and Challenges'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.94로 LLM Reasoning and Safety Benchmarks와 Agentic AI for Scientific Automation가 맞닿아, 'Kosmos: An AI Scientist for Autonomous Discovery'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구LLM 기반 인과추론 방법 선택의 이론적 기반을 제공한다.
기반 연구구조화된 결정 트리 기반 방법 선택의 방법론적 기반을 공유함
기반 연구SPECTER2 유사도 0.95로 LLM Reasoning and Safety Benchmarks와 Agentic AI for Scientific Automation가 맞닿아, 'Heterogeneous Scientific Foundation Model Collaboration'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근LLM 기반 연구 자동화의 다른 워크플로우 설계를 제시한다.
후속 연구자가교정 피드백 루프를 확장한 causal agent 연구로 판단됨
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드