CausalGame: Benchmarking Causal Thinking of LLM Agents in Games

저자: Zhenhao Chen, Yongqiang Chen, Chenxi Liu, Junchi Yu, Xiangchen Song, Zijian Li, Jialin Li, Philip Torr, Bo Han, Kun Zhang | 날짜: 2026 | URL: https://openreview.net/forum?id=WNqIX3IFZU 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 4

CausalGame은 LLM 에이전트의 causal thinking 능력을 평가하기 위해 hidden confounder, selection bias, noisy measurement가 포함된 14개의 interactive game 시나리오로 구성된 벤치마크이며, 29개의 frontier LLM을 평가한 결과 대부분의 에이전트가 correlation과 causation을 구분하지 못하고 spurious statistical clue에 쉽게 현혹됨을 보인다.

Motivation

Achievement

Figure 4
  1. CausalGame 벤치마크 구축: hidden confounder, selection bias, noisy measurement를 반영한 14개 game scenario를 설계해 structural causal model(SCM) 기반의 controlled testbed를 제공했다.
  2. 다차원 자동 평가 체계: drone design의 품질뿐 아니라 agent가 제출하는 explanation report까지 rubric 기반으로 fine-grained하게 평가하는 자동화된 평가 파이프라인을 구축했다.
  3. 대규모 실증 평가: 29개의 frontier LLM agent를 대상으로 실험을 수행해, 이들이 selection bias, noisy measurement, hidden confounder 하에서 일관되게 causal mechanism을 식별하지 못하고 statistical clue에 오도됨을 실증적으로 규명했다.

How

Figure 3

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: CausalGame은 AI Scientist agent 평가에서 그동안 간과되었던 causal thinking과 observational pitfall이라는 중요한 축을 체계적으로 다룬 유의미한 벤치마크로, LLM의 근본적 한계를 명확히 드러내는 실증 결과를 제공한다는 점에서 가치가 크다.

같이 보면 좋은 논문

기반 연구LLM 에이전트를 실제 정책 분석 문제에 적용한 사례로서 UrbanCIA와 유사한 응용 맥락을 가진다.
기반 연구SPECTER2 유사도 0.94로 LLM Reasoning and Safety Benchmarks와 Agentic AI for Scientific Automation가 맞닿아, 'Towards Scientific Intelligence: A Survey of LLM-based Scientific Agents'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 Agentic AI for Scientific Automation가 맞닿아, 'AI scientists produce results without reasoning scientifically'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구hidden confounder 등 causal reasoning의 핵심 개념을 공유하는 이론적 기반
기반 연구SPECTER2 유사도 0.94로 LLM Reasoning and Safety Benchmarks와 AI-Driven Drug and Materials Discovery가 맞닿아, 'SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근virtual cell에서의 생물학적 메커니즘 추론을 위한 다른 방법론을 제시한다.
다른 접근LLM 기반 과학 발견의 대안적 스크래치패드 방법론을 제시함
다른 접근게임 기반 시나리오로 LLM의 특정 인지 능력을 평가하는 유사한 벤치마크 설계
다른 접근지식그래프 기반 설명 및 에이전트 접근이라는 유사 문제를 다룬다.
다른 접근LLM agent의 추론 능력을 평가하는 유사한 벤치마크 접근
후속 연구causal discovery 방법론을 LLM agent 평가라는 새로운 응용 영역으로 확장
응용 사례AI 과학자 시스템의 추론 능력을 벤치마크로 평가하는 응용 사례이다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드