CITE: Anytime-Valid Statistical Inference in LLM Self-Consistency

저자: Hirofumi Ota, Naoto Iwase, Yuki Ichihara, Junpei Komiyama, Masaaki Imaizumi | 날짜: 2026 | URL: https://openreview.net/forum?id=rLSNTN1LYy 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. Overview of the stopping rule by CITE. With the countably infinite set of categories A, CITE tests the hypothe

LLM의 self-consistency에서 특정 정답 후보 r이 응답 분포의 유일한 mode임을 인증하는 문제를 anytime-valid sequential testing으로 정식화하고, 미리 알 수 없는 무한 카테고리 집합 하에서도 임의의 data-driven stopping rule에 대해 오류율을 엄밀히 통제하는 CITE 알고리즘을 제안한다.

Motivation

Achievement

Figure 2

Figure 2. Mean accuracy vs. sample budget on Qwen3-30B (top) and gpt-oss-20b (bottom), across AIME 2026, FrontierScience

  1. Anytime-valid category-agnostic 오류 보장: 답변 카테고리 집합에 대한 사전 지식 없이도 임의의 stopping time에 대해 균일하게 Type-I error를 ε 이하로 통제함을 증명(Theorem 4.1).
  2. Category-size-free stopping-time: CITE의 정지 시간 오더가 카테고리 집합 크기에 무관함을 보이고(Theorem 4.3), 이에 상응하는 minimax lower bound를 도출(Theorem 4.4)하여 주요 영역에서 상수배 차이까지 최적임을 입증.
  3. Confidence-weighted voting으로의 확장: 가중 관측치 및 gap을 다루도록 CITE를 확장하고 동일한 anytime-valid 오류 통제 및 정지 시간 속도를 유지함을 증명(Section 5).
  4. 실증적 성능 검증: 시뮬레이션과 세 가지 LLM 벤치마크 실험을 통해 CITE가 Type-I error를 경험적으로 통제하며, diffuse-tail 상황에서 기존 baseline과 동등하거나 더 나은 인증 성능을 보임을 확인.

How

Figure 1

Figure 1. Overview of the stopping rule by CITE. With the countably infinite set of categories A, CITE tests the hypothe

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 무한하고 사전 미지의 카테고리 집합 하에서 anytime-valid하게 오류를 통제하는 최초의 LLM self-consistency 인증 프레임워크로, 이론적 엄밀성과 실용적 함의를 모두 갖춘 견고한 워크숍 논문이다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.91로 Reinforcement Learning Policy Optimization와 Formal Methods and Computational Reasoning가 맞닿아, 'Through the lens of core competency: Survey on evaluation of large language models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.90로 Reinforcement Learning Policy Optimization와 Formal Methods and Computational Reasoning가 맞닿아, 'The Llama 3 Herd of Models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.90로 Reinforcement Learning Policy Optimization와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'PAG: Multi-Turn Reinforced LLM Self-Correction with Policy as Generative Verifier'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구membership testing 문제를 다른 확률 모델로 확장함
다른 접근응답 분포의 mode 검증을 위한 대안적 통계 기법을 제시
기반 연구anytime-valid sequential testing의 이론적 기초를 제공한다.
다른 접근LLM self-consistency 검증을 다른 통계적 프레임워크로 접근한다.
다른 접근응답 분포의 mode 인증이라는 유사 문제를 다른 방식으로 다룬다.
다른 접근후보 답안 간 비교 정보를 활용하는 유사한 test-time 앙상블 방법론이다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드