The Illusion of Intent: Linear Probes as Sophisticated Keyword Counters in LLM Safety Detection

저자: Ghanem AMARI, Valentin NOËL, Charly Ken Capo-Chichi | 날짜: 2026 | URL: https://openreview.net/forum?id=tYc8h8j4DG 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

LLM 안전 탐지에 사용되는 linear probe가 AgentDojo 등에서 보이는 near-perfect한 cross-dataset AUROC(≈1.0) 성능이 실제로는 의미론적 intent 이해가 아니라 소수의 표면적 lexical 토큰(예: ignore, bypass, system, instruction)에 의존한 Clever Hans 현상임을 lexical ablation 실험으로 규명한다.

Motivation

Achievement

Figure 2

Figure 2. Leave-one-layer-out ∆AUROC on Cahinted Thatures for three backbone models..

  1. Cross-dataset 성능 재현: InjecAgent+AdvBench로 학습, AgentDojo로 평가 시 5개 LLM backbone(Llama-3.2-1B/3B, Mistral-7B-v0.3, Qwen2.5-1.5B 등) 모두에서 AUROC=1.0을 재현하여 기존 결과를 확인.
  2. Lexical ablation을 통한 붕괴 입증: TF-IDF logistic regression으로 추출한 top-50 predictive token(ignore, bypass, system prompt, instruction, disregard 등)을 redaction한 후 재학습·평가한 결과, 모든 backbone에서 AUROC가 1.0에서 0.10 미만으로 붕괴하며 일부는 random chance보다도 낮은 anti-correlated한 수준을 보임.
  3. Leave-one-layer-out 분석: 특정 layer 제거 시 AUROC 변화(∆AUROC)를 측정하여 safety 관련 신호가 특정 layer에 집중되어 있는지 진단.
  4. Contrastive paired 데이터셋 구축: 동일 어휘·문법 구조를 공유하되 intent만 다른 benign/malicious 1,120개 프롬프트 쌍(560/560)을 새로 구성하여 기존 프로빙 방식의 취약점을 노출.
  5. CIP 제안 및 예비 검증: 표준 probe가 same-vocabulary contrastive 쌍에서 AUROC 0.566에 그치는 반면, contrastive supervision과 margin loss로 학습된 CIP(2-layer MLP)는 AUROC 0.721로 개선됨을 pilot study로 확인.

How

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: LLM safety probing 분야에서 당연시되던 near-perfect 성능 해석에 대해 간결하고 설득력 있는 반증을 제시한 점에서 가치 있는 workshop 논문이나, 제안된 해결책(CIP)이 아직 예비 단계에 머물러 있어 후속 검증이 필요하다.

같이 보면 좋은 논문

기반 연구probe 기반 분석 방법론의 이론적 기초를 제공한다.
기반 연구probe 기반 탐지 기법의 기초 방법론을 제공함
다른 접근안전 탐지를 위한 다른 방법론적 접근을 제시한다.
후속 연구안전 탐지 메커니즘의 실제 이해 능력을 검증하는 확장 연구
후속 연구contrastive learning 기반 검색 개선의 이론적 토대를 공유한다.
반론/비판linear probe의 성능이 실제로는 표면적 패턴에 의존한다는 비판적 관점을 공유한다.
반론/비판linear probe의 표면적 패턴 매칭 문제를 지적하는 비판적 관점을 공유
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드