Sticks and Stones: Positive vs. Negative Emotional Prompt Framings

저자: Vipul Joshi, Vikash Sharma, Anurag Tripathi, Peyush jain, Ujjal Das, Archan Karmakar | 날짜: 2026 | URL: https://openreview.net/forum?id=jPLicfZ3WY 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

EmotionPrompt가 주장한 8–115%의 정서적 프롬프트 효과가 대규모 within-subjects 디자인에서 재현되지 않으며, 긍정과 부정 정서 프레이밍은 정확도 측면에서 통계적으로 구별 불가능함을 28,000 trial 규모의 사전등록 실험으로 입증한다.

Motivation

Achievement

Figure 1
  1. 강력한 null 결과 확립: 중립 baseline 88.9%에서 긍정과 부정 프레이밍은 구별 불가능(+0.04pp, p=0.91, 95% CI [-0.34, +0.42]pp, Cohen's d≈0.001)하며, 이는 sycophancy와 stress-degradation 문헌이 보고하는 2–5pp 규모의 비대칭성을 배제할 만큼 정밀하다.
  2. 원 연구 주장의 실패 재현: EmotionPrompt의 8–115% 효과 주장이 200–1,319개 item/cell 및 within-subjects pairing을 갖춘 설계에서는 재현되지 않음을 보였다.
  3. 대안 메커니즘(task-irrelevant distraction) 지지: 사후적이지만 비정서적 distractor control 실험을 통해 정서적 내용이 특별한 것이 아니라 단순히 task와 무관한 주의분산 요소로 작동함을 시사하는 증거를 제시했다.
  4. 방법론적 모범 사례 제시: item-level ICC=0.51, 1pp 효과에 대해 99% 이상의 power를 갖춘 사전등록·within-subjects·삼각검증 설계를 LLM 행동 연구에 적용한 사례를 제공했다.

How

Figure 1

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 5/5 Significance: 4/5 Clarity: 5/5 Overall: 4/5

총평: 대규모·사전등록·within-subjects 설계와 삼중 통계 삼각검증을 통해 널리 인용되는 EmotionPrompt 주장의 취약성을 명확히 드러낸 모범적인 방법론 연구로, LLM 행동 연구 커뮤니티에 통계적 엄밀성의 기준을 제시하는 중요한 기여를 한다. 다만 핵심 발견은 대체로 null 결과이며 실용적 함의(어떤 개입이 효과적인가)에 대한 새로운 긍정적 지침은 제한적이다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.91 기준으로 'Sticks and Stones: Positive vs. Negative Emotional Prompt Framings'의 AI4S 방법론을 'The Matthew effect in science funding'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
기반 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Openai o1 system card'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구대규모 within-subjects 실험 설계의 방법론적 기반을 제공함
다른 접근프롬프트 엔지니어링 기법의 효과성을 다른 방법으로 검증함
다른 접근LLM 프롬프트 효과 검증을 위한 다른 실험 설계 방식을 제시함
다른 접근steering 방법의 효과성을 다른 방식으로 검증하는 접근
반론/비판LLM 프롬프트 효과에 대한 재현 불가능성을 지적하는 유사한 비판적 연구임
반론/비판정서적 프롬프트 효과에 대한 재현성 검증으로 원 연구의 주장을 반박함
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드