Linear-LLM-SCM: Benchmarking LLMs for Coefficient Elicitation in Linear-Gaussian Causal Models
저자: Kanta Yamaoka, Sumantrak Mukherjee, Thomas Gärtner, David Antony Selby, Stefan Konigorski, Eyke Hüllermeier, Viktor Bengs, Sebastian Josef Vollmer | 날짜: 2026 | URL: https://openreview.net/forum?id=IvUFTCiHxS📄 PDF
⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.
라이선스: OpenReview 공개(오픈액세스)
Essence
Figure 1. An example configuration of plug-and-play DAG yaml for our open-source framework.
이 논문은 사전에 주어진 DAG 구조에서 LLM이 Linear Gaussian structural causal model의 회귀 계수(coefficient)를 얼마나 정확하고 안정적으로 추정할 수 있는지를 평가하는 Linear-LLM-SCM이라는 벤치마킹 프레임워크를 제안한다.
Motivation
Known: 기존 연구들은 LLM이 도메인 지식을 활용해 정성적 causal relation(Type 1 task)을 식별하는 데는 어느 정도 능력을 보이지만, 데이터로부터 새로운 지식을 발견(Type 2)하거나 결과를 정량적으로 추정(Type 3)하는 데는 한계가 있다는 것이 알려져 있다.
Gap: 연속형(continuous) 도메인에서 LLM이 functional relationship을 파라미터화하는 정량적 causal reasoning 능력, 특히 effect size(회귀 계수)를 직접 추정하는 능력에 대한 체계적 평가는 거의 이루어지지 않았다는 연구 공백이 존재한다.
Why: 의료(healthcare)와 같은 safety-critical 도메인에서 관측 데이터 없이 LLM이 causal effect의 크기를 신뢰성 있게 elicit할 수 있는지 파악하는 것은 LLM 기반 의사결정 지원 시스템의 안전성과 신뢰성을 확보하는 데 필수적이다.
Approach: DAG을 local parent-child 구조로 분해하고 각 노드에 대해 LLM에게 regression-style structural equation을 elicit하도록 prompting한 뒤, 이를 aggregation하여 전체 SCM 파라미터를 구성하고 실제 ground-truth 계수와 비교하는 plug-and-play 프레임워크를 제안한다.
Achievement
Figure 2. An example prompt and its LLM response structure at the Expenditure DAG at Income target variable. The output
Linear-LLM-SCM 프레임워크 개발: DAG, 변수 설명(description), 단위(unit), 제약(constraint)을 입력받아 LLM이 노드별 linear structural equation을 elicit하도록 하는 plug-and-play 오픈소스 파이프라인을 구축했다.
다중 실측 DAG 실험: 7개의 real-world DAG와 ground-truth effect를 활용하여 Gemini 2.5 Flash, Llama 3 계열, GPT-5.4 등 다양한 아키텍처(dense, mixture-of-experts 등)의 LLM을 평가했다.
한계 및 취약성 규명: 대부분의 모델에서 coefficient estimate의 변동성(variability)과 DAG misspecification, 변수 단위 변경 등 구조적 perturbation에 대한 민감성을 관찰하여 LLM이 quantitative causal parameterizer로서 한계가 있음을 실증했다.
평가 지표 정립: ground-truth와 LLM이 elicit한 파라미터 벡터 간 거리 및 상대적 effect-size ordering을 측정하는 (M1)-(M4) 지표를 제시했다.
How
Figure 3. An example of a prompt for a local parent-child structure in a DAG.
DAG를 topological order로 순회하며 각 target node에 대해 direct parent들의 설명, 단위, 범위(range)를 포함한 prompt를 LLM에 전달
prompt는 (1) domain expert persona 및 현상 요약, (2) parameterization task와 linear equation template 및 변수 범위, (3) output format(추론 과정 후 structural equation 문자열)의 세 부분으로 구성
LLM이 반환한 텍스트 구조 방정식에서 intercept와 parent coefficient를 파싱(response parsing)
사전에 정의된 hard constraint를 이용한 iterative feedback refinement 메커니즘으로 sanity check 및 재시도를 수행해 global consistency 확보
도출된 coefficient들을 aggregation하여 ground-truth와 (M1)-(M4) 지표로 비교
Originality
기존 연구들이 causal discovery나 정성적 관계 판별에 집중하거나, sampling 기반 conditional distribution 추정(Bynum & Cho, 2025)에 의존한 것과 달리, 본 연구는 관측 데이터 없이 causal structure와 변수 semantics만으로 continuous linear causal effect parameter를 직접 elicit하는 최초의 접근을 시도한다.
local parent-child decomposition을 통해 전체 DAG를 텍스트로 표현하는 대신 국소 구조 단위로 LLM에 질의하는 설계를 채택하고, iterative feedback refinement로 constraint 기반 검증을 결합한 점이 독창적이다.
plug-and-play 오픈소스 프레임워크로 임의의 DAG, 변수 메타데이터, LLM을 조합해 평가할 수 있도록 일반화한 벤치마킹 도구를 제공한다.
Limitation & Further Study
linear Gaussian SCM이라는 제한적 함수 형태만을 다루어 비선형(non-linear) 관계나 non-Gaussian noise를 포함하는 현실적 causal system에는 일반화하기 어렵다.
7개의 DAG만을 사용한 실험으로 표본 수가 제한적이며, 도메인 다양성 및 통계적 유의성 확보가 부족할 수 있다.
ground-truth DAG 자체의 불확실성(structural misspecification 가능성)을 인정하면서도, 이에 대한 체계적인 sensitivity 분석은 제한적으로만 다루어졌다.
향후 연구로 비선형 SCM, 다양한 noise 분포, 더 많은 실측 도메인(특히 헬스케어)으로의 확장, 그리고 데이터 leakage를 통제한 강건성 검증이 필요하다.
총평: LLM의 causal reasoning 능력 중 상대적으로 덜 탐구된 quantitative parameterization 측면을 체계적으로 벤치마킹하는 시의적절하고 실용적인 프레임워크를 제시하나, 실험 규모와 함수 형태의 제한으로 인해 추가 검증이 필요한 워크숍 수준의 초기 연구로 평가된다.
기반 연구SPECTER2 유사도 0.93로 Computational Molecular Design와 AI-Driven Drug and Materials Discovery가 맞닿아, 'LLM4GRN: Discovering causal gene regulatory networks with llms–evaluation through synthetic data generation'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.92로 Computational Molecular Design와 Agentic AI for Scientific Automation가 맞닿아, 'Celcomen: spatial causal disentanglement for single-cell and tissue perturbation modeling'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.