Anytime-Valid Hypothesis Testing for Sparse Autoencoder Feature Validation

저자: Rudransh Khera | 날짜: 2026 | URL: https://openreview.net/forum?id=R4F3Nixhhc 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. FDR control and power on the synthetic experiment,

Sparse autoencoder(SAE) feature를 인과적 필요성(causal necessity) 기준으로 검증하기 위해, paired ablation intervention에서 e-process를 구성하고 e-BH procedure로 feature dictionary 전체에 대해 false discovery rate(FDR)를 제어하는 anytime-valid sequential hypothesis testing 프레임워크를 제안한다.

Motivation

Achievement

Figure 3

Figure 3. FDR control on synthetic SAE data: our procedure (e-BH

  1. synthetic ground-truth 검증: attention-only transformer와 소형 SAE에서 exhaustive ablation으로 oracle ground truth를 확보하여, 10개 seed에 걸쳐 α=0.05에서 empirical FDP = 0.000 ± 0.000으로 FDR을 목표 수준 이하로 통제함을 보였다.
  2. 효과 크기 비례 검출력: 강한 causal effect를 가진 feature는 거의 100% 확률로 검출되고, 약한 feature는 예상대로 기각되지 않아, 절차가 true causal effect size에 비례하여 feature를 복원함을 입증했다.
  3. 실제 모델(GPT-2 small) 검증: 공개된 residual-stream SAE와 indirect object identification(IOI) benchmark를 사용해 K=89개 candidate 중 6개 feature를 α=0.05에서 기각했으며, 이 중 5개는 Neuronpedia에 게시된 해석이 task 구조(소유권 이전, 수령인, 수여)와 직접 일치했다.
  4. baseline 대비 우위: Gaussian fit을 사용한 Model-X knockoffs baseline은 동일 데이터에서 0개를 기각했고, 더 높은 α 수준에서는 empirical FDR 위반까지 보여, 제안 절차의 명확한 이점을 입증했다.

How

Figure 4

Figure 4. Wealth trajectories for the three highest-e-value features

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: SAE feature 해석 가능성 검증에 만연한 ad hoc 관행에 통계적으로 엄밀한 anytime-valid testing과 FDR 통제를 도입한 시의적절하고 실용적인 연구로, synthetic 및 실제 GPT-2 실험을 통해 baseline 대비 명확한 이점을 보였으나 상대적 estimand의 근본적 한계와 더 넓은 검증 범위 확장이 향후 과제로 남아있다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.91 기준으로 'Anytime-Valid Hypothesis Testing for Sparse Autoencoder Feature Validation'의 AI4S 방법론을 'Augmenting the veracity and explanations of complex fact checking via iterative self-revision with llms'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
기반 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 AI-Driven Drug and Materials Discovery가 맞닿아, 'A Comprehensive Survey of Scientific Large Language Models and Their Applications in Scientific Discovery'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구e-BH procedure 등 통계적 검정 방법론의 기반 제공
기반 연구e-process 기반 anytime-valid 검정의 방법론적 기반을 제공하는 연구이다.
후속 연구baseline saturation 개념의 기초적 정량화 방법을 제공함
기반 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 Agentic AI for Scientific Automation가 맞닿아, 'Hunt Globally: Wide Search AI Agents for Drug Asset Scouting in Investing, Business Development, and Competitive Intelligence'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 AI-Driven Drug and Materials Discovery가 맞닿아, 'Agentic Discovery of Exchange-Correlation Density Functionals'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근e-process 기반 anytime-valid 검정 방법론을 다른 도메인(연구 에이전트)에 적용한 확장 관계.
다른 접근인과적 필요성 검증을 위한 다른 통계적 검정 접근이다.
다른 접근인과적 필요성 검증을 위한 e-BH procedure라는 유사한 통계 프레임워크를 공유함.
후속 연구Model-X knockoff 기법의 통계적 기초를 제공한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드