Behavior Is Not Representation: Hypothesis Tests for Concept Steering in LLMs

저자: Siddharth Shukla | 날짜: 2026 | URL: https://openreview.net/forum?id=T94DrCVgxm 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. The structural-behavioral disconnect at Layer 12. The

SAE 기반 ground-truth 특징과의 정합성을 검증하는 Structural Specificity Testing(SST) 프로토콜을 제안하여, steering이 행동적으로는 성공해도 실제로는 concept-specific representation을 회복하지 못함을 950개 concept, 4가지 steering 방법, Gemma-2-2B-IT의 5개 layer에서 통계적으로 입증한다.

Motivation

Achievement

Figure 1

Figure 1. The structural-behavioral disconnect at Layer 12. The

  1. 구조-행동 분리 현상 규명: 분석적 방법(DiffMean, LAT, PCA)은 concept과 무관하게 전체 concept의 80% 이상에서 발화하는 고빈도 formatting feature로 거의 전적으로 분해되는 반면, 가장 강한 behavioral 효과(∆logit=+4.1)를 내는 gradient 기반 SteeringVectors는 구조적으로 직교하는 subspace(Jaccard<0.025)를 차지함을 밝혔다.
  2. GT 회복 실패의 통계적 입증: Bonferroni 보정을 거친 SST에서 20개 configuration 전부 H0를 기각하지 못해(padj=1.0), 어떤 방법도 SAE ground-truth feature를 유의미하게 회복하지 못함을 보였다.
  3. hygiene-controlled CryptoBench 도입: 450개 암호학 concept으로 구성된 confound-통제 벤치마크를 통해 분석적 방법은 부분적으로 LRH와 일치하는 moderate correlation(DiffMean r=0.632, LAT r=0.584)을 보이나 SteeringVectors는 거의 상관관계가 없음(r=0.042)을 확인했다.
  4. 이중 해리(double-dissociation) 인과 분석: causal ablation을 통해 dominant formatting feature와 concept 연관 semantic feature 어느 쪽도 behavioral steering 효과를 주로 매개하지 않음을 보여, 미지의 메커니즘이 작동함을 시사했다.

How

Figure 2

Figure 2. Pearson correlation (r) between SAE-GT alignment and

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: Steering 연구에서 오랫동안 암묵적으로 가정되어온 behavioral success와 representational fidelity의 등치를 통계적 가설검정으로 명확히 반박하는 중요한 연구로, interpretability 및 alignment 평가 방법론에 실질적인 경각심과 새로운 검증 표준을 제시한다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Language agents mirror human causal reasoning biases'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구LLM 자기평가 신뢰성에 대한 연구를 확장한다.
다른 접근steering 방법의 행동적 성공과 실제 표현 회복 간의 괴리를 다루는 유사한 문제의식을 공유한다.
기반 연구SAE 기반 개념 표현 학습의 기초 이론을 제공
다른 접근동일한 LLM 안전성/거부 행동 평가 문제를 다른 실험 설계로 접근하는 관련 연구이다.
기반 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 AI-Assisted Academic Scholarly Communication가 맞닿아, 'PaperBanana: Automating Academic Illustration for AI Scientists'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 Agentic AI for Scientific Automation가 맞닿아, 'Towards a Medical AI Scientist'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근steering 방법의 효과성을 다른 방식으로 검증하는 접근
다른 접근추론 타당성 판별을 위한 다른 형태의 내부 신호 기반 지표를 사용한다.
후속 연구concept steering의 representation 검증을 확장하는 연구
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드