Beyond the Frontier: Stochastic Backtracking for Efficient Test-Time Scaling

저자: Dao Tran, Duc Anh Le, Tien Ngoc Luu, Quan Pham, Tung Pham, Hung H Bui | 날짜: 2026 | URL: https://openreview.net/forum?id=XiIVpZvJ2L 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. Schematic comparison of frontier-only search and persistent-pool backtracking. Frontier-only methods keep only

PRM(process reward model)로 안내되는 test-time scaling에서 frontier-only 탐색이 노이즈가 있는 PRM 점수로 인해 되돌릴 수 없는 가지치기를 유발한다는 문제를 지적하고, 과거에 생성된 prefix를 persistent pool에 보관해 재방문 가능하게 하는 stochastic backtracking 프레임워크(Subpool Selection, Power Backtrack SMC)를 제안한다.

Motivation

Achievement

Figure 2

Figure 2. Accuracy–compute trade-off on MATH500 using Qwen2.5-7B-Instruct. Each curve varies the number of parallel traj

  1. Persistent-pool 탐색 프레임워크 제안: frontier-only 구조 대신 각 라운드마다 고정된 예산 N개의 새 prefix만 생성하면서도 전체 이력을 최대 Nt개의 선형 메모리로 유지하는 persistent pool 개념을 도입했다.
  2. Subpool Selection 메커니즘: 무작위로 구성한 historical subpool 내에서 Top-N 선택을 적용해, 과도하게 높은 점수를 받은 frontier 후보에 가려졌던 과거 prefix가 다시 선택될 기회를 제공한다.
  3. Power Backtrack SMC(PB-SMC) 메커니즘: Persistent Sampling 개념을 시퀀셜 non-Markovian 상태공간 추론으로 확장하여, powered PRM 점수와 mixture-corrected weight를 사용한 multiple-importance-sampling 기반 resampling을 persistent pool 전체에 적용한다.
  4. 정확도-토큰 트레이드오프 개선 실증: 여러 수학 추론 벤치마크와 모델 스케일에서, 강력한 PRM-guided baseline 대비 토큰당 더 높은 정확도를 달성하고, 동일 정확도를 더 적은 토큰 수로 달성함을 보였다.

How

Figure 2

Figure 2. Accuracy–compute trade-off on MATH500 using Qwen2.5-7B-Instruct. Each curve varies the number of parallel traj

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: PRM-guided test-time scaling의 고질적 문제인 비가역적 frontier-only 가지치기를 persistent pool과 stochastic backtracking으로 해결하려는 시도가 이론적으로도 실용적으로도 설득력 있게 제시된 논문으로, 수학 추론 벤치마크에서의 실증 결과가 이를 뒷받침한다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.90로 LLM Agent Reasoning Training와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Evaluating large language models trained on code'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.90로 LLM Agent Reasoning Training와 Molecular Simulation and Generative Modeling가 맞닿아, 'SamplingDesign: RNA design via continuous optimization with coupled variables and Monte-Carlo sampling'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.90로 LLM Agent Reasoning Training와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'An AI system to help scientists write expert-level empirical software'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근PRM 기반 test-time scaling에서 노이즈 문제를 다루는 다른 탐색 전략을 제시한다.
다른 접근test-time compute 확장을 위한 대안적 탐색 프레임워크를 제안한다.
후속 연구frontier 탐색의 한계를 극복하는 백트래킹 기법을 확장하여 다룬다.
반론/비판frontier 기반 탐색 방식의 문제점을 지적하는 유사한 비판적 관점을 취한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드