Deadline-Valid Replay: Anytime-Valid Testing for LLM Inference Policies

저자: Rui Gao | 날짜: 2026 | URL: https://openreview.net/forum?id=KcqIBf7un6 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1.

이 논문은 LLM inference policy(예: greedy, self-consistency, budget branch, selective abstain) 간의 비교를 deadline 조건 하에서 paired sequential testing 문제로 정식화하고, anytime-valid mixture betting e-process를 이용해 leaderboard상의 descriptive 차이가 통계적으로 인증된 우위인지 검증하는 replay 기반 평가 프레임워크를 제안한다.

Motivation

Achievement

Figure 1

Figure 1.

  1. Deadline-conditioned paired testing 정식화: Deadline utility U_{i,τ}와 policy 쌍 간 paired difference D_{i,τ}를 정의하고, 이를 anytime-valid e-process로 검증하는 통계적 프레임워크를 제시했다.
  2. Qwen2.5 기반 4-slice trace-bank 실증 연구: GSM8K, BBH, ARC, CoLA 네 가지 태스크에서 descriptive leader가 태스크와 deadline에 따라 달라짐을 보였다.
  3. 통계적 미인증(non-certification) 결과 도출: 관찰된 최대 e-value가 3.675로 unadjusted threshold 20 및 Bonferroni-family threshold 1440에 크게 못 미쳐, 어떤 비교도 통계적으로 인증된 우위를 주장할 수 없음을 보임으로써 descriptive ranking과 certified claim을 명확히 분리했다.
  4. 재현 가능한 오픈 리포지토리 공개: frozen replay config, trace-bank manifest, validation metadata를 포함한 공개 저장소를 제공하여 향후 pre-registered 분석의 기반을 마련했다.

How

Figure 1

Figure 1.

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 3/5 Clarity: 4/5 Overall: 3/5

총평: LLM inference policy 평가에 anytime-valid sequential testing을 도입한 개념적으로 참신하고 방법론적으로 견고한 워크숍 논문이나, 실증 결과가 "인증 실패(non-certification)"에 그쳐 실질적 임팩트는 제한적이며 더 넓은 모델·태스크 범위와 pre-registered 후속 연구가 필요하다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.92로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Through the lens of core competency: Survey on evaluation of large language models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 Scientific AI for Physics and Environment가 맞닿아, 'From LLMs to LLM-based Agents for Software Engineering: A Survey of Current, Challenges and Future'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'The Llama 3 Herd of Models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근sequential testing 문제를 다른 방식으로 접근한 대안적 프레임워크
후속 연구anytime-valid testing 개념을 LLM 평가에 확장 적용함
응용 사례LLM 추론 정책 평가에 sequential testing을 적용한 사례이다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드