Total Variation Distance Estimation in Autoregressive Models

저자: Eric Price, Kevin Tian, Zhiyang Xun, Yusong Zhu | 날짜: 2026 | URL: https://openreview.net/forum?id=FZ8PTjTUO6 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

두 개의 length-n autoregressive 분포(예: 서로 다른 LLM 추론 엔진) 사이의 total variation (TV) distance를 sample access, logit access, noisy logit access 세 가지 접근 모델 하에서 additive error ε로 추정하는 알고리즘과 그에 대한 tight query complexity 상한/하한을 제시한다.

Motivation

Achievement

Figure 2
  1. Sample access 하 개선된 query complexity: prefix sampling oracle만으로 $\widetilde{O}(n^2K/\varepsilon^2)$ query로 TV distance를 추정하는 알고리즘을 제시하여, 기존 Meel et al.(2025)의 $O(n^3m/\varepsilon^5)$보다 n, ε 의존성과 m/K 팩터 측면에서 크게 개선하였다.
  2. Logit access 하 tight bound 확립: $O(n/\varepsilon^2)$ query로 TV distance를 추정하는 알고리즘을 제시하고, 동시에 이 query complexity가 상수 배수까지 tight함을 보이는 matching lower bound(hidden parameter p로 인덱싱된 hard instance)를 구성하였다. 이는 logit access 하에서 TV 추정 문제를 최초로 공식화하고 완전히 해결한 결과이다.
  3. Noisy logit access 모델 공식화 및 알고리즘: 실제 추론 엔진의 비결정성을 반영한 relative-variance σ 기반 noisy prefix distribution oracle 모델을 정의하고, $\widetilde{O}((n+n^2\sigma^2)/\varepsilon^2)$ query로 동작하며 σ=0일 때 logit access 결과를, K에 대응할 때 sample access 결과를 (log factor까지) 정확히 회복하는 알고리즘을 MLMC 기반 분산 감소로 설계하였다.
  4. 실증적 검증: sglang과 vllm 등 실제 production 추론 엔진 간 TV distance를 측정하는 실험을 수행하여, 이론적 알고리즘의 견고성과 실용성을 입증하고, KL divergence 대비 TV distance 추정이 더 강건함을 보였다.

How

Figure 3

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: KL divergence의 실용적 한계를 명확히 지적하고 이를 대체할 TV distance 추정 문제를 세 가지 access 모델에서 이론적으로 엄밀하게(특히 logit access에서 tight bound까지) 해결하면서 실제 추론 엔진 실험으로 실용성을 입증한, 이론과 실무를 균형있게 연결한 견고한 연구이다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.90로 Reinforcement Learning Policy Optimization와 Scientific Information Extraction and QA가 맞닿아, 'Gemma 2: Improving open language models at a practical size'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.90로 Reinforcement Learning Policy Optimization와 Molecular Simulation and Generative Modeling가 맞닿아, 'SamplingDesign: RNA design via continuous optimization with coupled variables and Monte-Carlo sampling'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근언어 모델의 확률적 특성을 분석하는 통계적 프레임워크와 관련됨
다른 접근확률 분포 추정 및 접근 모델(sample/logit access)에 따른 통계적 방법론이 연관됨
다른 접근LLM 등 autoregressive 모델 간의 분포 차이를 통계적으로 추정하는 유사한 문제 설정을 다룸
후속 연구quantum 회로 학습 이론의 기초적 접근법을 공유한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드