Safety Overestimation: A Framework for Identifying Superficial Alignment in Large Language Models

저자: Sharvin Goyal | 날짜: 2026 | URL: https://openreview.net/forum?id=xm2Ksake18 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. The Safety Overestimation Framework. Five mechanisms (gray boxes) explain the structural component of the eval

본 논문은 LLM의 벤치마크 안전성 점수와 실제 배포 환경 안전성 사이의 구조적 괴리를 "safety overestimation"이라는 개념으로 정식화하고, 이를 탐지하기 위한 five mechanisms 분류체계와 Safety Overestimation Index(SOI)라는 감사 프레임워크를 제안한다.

Motivation

Achievement

Figure 3

Figure 3. Hypothetical SOI profiles for two models with similar

  1. Safety Overestimation의 형식적 정의: Safe(M,P) 함수와 ∆(M) = Safe(M,E) - Safe(M,D)를 정의하고, Ben-David et al.(2010)의 domain adaptation 분해를 응용해 ∆(M) = ∆dist(M) + ∆struct(M)로 나눈 뒤, ∆struct(M) > ε이면서 이것이 evaluation construct의 decoupling에 인과적으로 귀속될 때 safety overestimation으로 정의한다(Definition 1).
  2. 다섯 가지 mechanism 분류체계: Benchmark Overfitting(extremal Goodhart), Refusal Theater(causal Goodhart), Context Collapse, Demographic Blind Spots 등 최소 4개 이상의 mechanism을 Goodhart's Law의 변종과 대응시켜 정리하고, 기존 문헌(Wei et al., Zou et al., Sharma et al., Ganguli et al., Hubinger et al. 등)의 실증 결과를 각 mechanism의 증거로 재해석한다.
  3. Safety Overestimation Index(SOI) 제안: 네 가지 formal design requirement를 갖춘 multi-criteria audit rubric을 제안하고 SOI-DBS와 같은 구체적 empirical instantiation(fairness 문헌의 coefficient-of-variation 방법 응용)을 제시하여 제3자 감사와 규제 표준에 활용 가능한 실무적 틀을 제공한다.

How

Figure 2

Figure 2. Hypothetical refusal rate curves as a function of conver-

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 3/5

총평: LLM 안전성 평가의 근본적 문제를 명확한 개념과 형식적 틀로 정리한 시의적절하고 통찰력 있는 개념 논문이지만, 실증적 검증이 부재한 순수 이론적 제안에 그치고 있어 향후 SOI의 실제 적용 연구가 뒷받침되어야 완성도를 갖출 것이다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'The Llama 3 Herd of Models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Grammars of formal uncertainty: When to trust llms in automated reasoning tasks'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근안전성 과대평가 문제를 다루는 유사한 진단 프레임워크임
후속 연구안전성 벤치마크와 실제 배포 환경 간의 괴리를 정식화하여 확장한 연구임
반론/비판벤치마크 기반 안전성 평가의 신뢰성에 의문을 제기하는 비판적 관점임
반론/비판안전성 벤치마크의 신뢰성을 의문시하는 대조적 관점을 제시함
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드