Predicting field experiments with large language models

저자: Yaoyu Chen, Yuheng Hu, Yingda Lu | 날짜: 2025 | DOI: 미제공 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

Essence

대규모 언어 모델(LLM)을 이용하여 경제학 문헌의 현장 실험(field experiment) 결과를 자동으로 예측하는 프레임워크를 제안하고, 276개 실험에서 78%의 예측 정확도를 달성했다.

Motivation

Achievement

Figure 1: The Data Collection Workflow

논문 수집 및 필터링 과정: 6,544개 논문에서 최종 276개의 현장 실험 선정

  1. 대규모 자동화 평가: 2000-2024년 경제학 주요 저널 276개 논문(1,261개 결론)에서 78% 평균 예측 정확도 달성 - 기존 소규모 수동 방식의 한계 극복
  2. 이분포/왜도 특성 발견: 예측 결과가 양극단 분포 - 71%의 결론에서 거의 100% 정확도, 18%에서는 거의 0% 정확도로 나타나, 특정 주제에 대한 LLM의 근본적 한계 시사
  3. 데이터 누수 방지 및 복잡성 증대: Claude(추출/검증용)와 GPT(예측용) 분리 사용, 인간-객체 상호작용 포함 복잡한 처치 설계 지원

How

Figure 2: Prediction Framework

3단계 프레임워크: 정보 추출(Claude) → 변형 생성(Claude) → 예측(GPT)

프레임워크 구성:

주요 특징:

Originality

Limitation & Further Study

한계:

후속 연구:

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 현장 실험 예측이라는 새로운 도메인으로 LLM 시뮬레이션을 확장하고 대규모 자동화 평가를 통해 실질적 적용 가능성을 보였으나, LLM의 근본적 한계(복잡한 사회 이슈 처리 부족)가 명확하여 실무 적용 시 주의가 필요한 연구이다.

같이 보면 좋은 논문

기반 연구1064는 과학의 과학에서 데이터 기반 예측 방법론을 종합하므로, 631의 LLM 기반 현장 실험 결과 예측 프레임워크의 이론적 배경을 제공한다.
기반 연구LLM 기반 인간 대체 실험을 더 큰 규모로 확장한다.
기반 연구419번은 LLM 기반 과학적 가설 생성 메커니즘을 상세히 다루어, 631번의 현장실험(outcome) 예측 태스크가 어떤 전제와 한계 위에 설계되는지 이해를 돕는다.
기반 연구대규모 언어모델의 제로샷 인과구조 추론 및 실험 결과 예측 능력에 대한 기초적 탐구를 제공한다.
다른 접근132도 AI를 활용한 심리학 가설 자동 생성 및 평가를 다루므로, 631의 LLM 기반 경제학 실험 결과 예측과 비교하면 AI의 과학적 예측 능력을 학문 분야별로 비교할 수 있다.
다른 접근330은 LLM 내부 지식으로 상관관계 놀라움을 정량화하고, 631도 LLM으로 경제학 현장 실험 결과를 예측하여 두 논문 모두 과학적 발견에서 LLM 사전 지식 활용을 서로 다른 방식으로 탐구한다.
다른 접근AI로 실험성과 예측을 수행한 사례로, 도메인(경제 vs AI/ML) 및 예측 방식(논문 벤치마크 vs 경제 데이터)별로 차이점을 분석할 수 있습니다.
후속 연구SPECTER2 유사도 0.89로 Reinforcement Learning Policy Optimization와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Predicting field experiments with large language models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
응용 사례191번 논문은 사회적으로 책임감 있는 AI와 인과 추론의 통합을 다루며, 631번 LLM 기반 현장실험 예측의 정책적 의의와 연계해서 읽으면 좋다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드