Aligning Tree-Search Policies with Fixed Token Budgets in Test-Time Scaling of LLMs

저자: Sora Miyamoto, Daisuke Oba, Naoaki Okazaki | 날짜: 2026 | URL: https://openreview.net/forum?id=TgaVuBX8dx 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

BG-MCTS는 고정된 토큰 예산(fixed token budget) 하에서 tree-search decoding의 탐색 정책을 남은 예산에 맞춰 동적으로 조정하는 MCTS 변형으로, 초반에는 넓은 탐색을 수행하고 예산이 소진될수록 유망 후보의 정제 및 답변 완성에 집중하도록 설계되었다.

Motivation

Achievement

Figure 3
  1. BG-PUCT 스코어 제안: 표준 PUCT 식의 exploration term에 ρ를 곱해 예산 감소에 따라 탐색 강도를 점진적으로 줄이고, exploitation term에는 depth-biased completion bias를 추가한 ˜W(s, ρ)를 도입하여 후반부에 얕은 노드보다 답변 완성에 가까운 깊은 노드를 선호하도록 만들었다.
  2. Budget-guided tree widening 메커니즘 제안: 남은 예산에 따라 새로운 자식 노드 생성 여부를 조절하여 후반부의 불필요한 branching을 억제한다.
  3. 일관된 성능 우위 입증: MATH500, AIME24/25 수학 추론 벤치마크와 UGPhysics 물리 추론 벤치마크, 그리고 Llama-3.1-8B-Instruct, Qwen2.5-7B-Instruct, Qwen3-32B 등 open-weight LLM들에 대해 토큰 예산 B∈{10k,20k,30k} 전 구간에서 budget-agnostic tree-search 베이스라인 대비 일관되게 우수한 정확도를 달성하였다.

How

Figure 2

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 고정 토큰 예산이라는 실용적 제약을 tree-search decoding 정책 설계에 명시적으로 통합한 점이 참신하며, 다양한 벤치마크와 모델에서 일관된 개선을 보여 실용성이 높은 연구이다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.92로 LLM Agent Reasoning Training와 Scientific Information Extraction and QA가 맞닿아, 'Fact-checking complex claims with program-guided reasoning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.92로 LLM Agent Reasoning Training와 Formal Methods and Computational Reasoning가 맞닿아, 'Towards large language models as copilots for theorem proving in lean'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.92로 LLM Agent Reasoning Training와 Scientific Information Extraction and QA가 맞닿아, 'Phi-4 technical report'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구sequential reasoning 검증을 확장하는 관련 연구
다른 접근tree-search decoding의 예산 제약 하 탐색 정책을 다른 방식으로 조정한다.
기반 연구생의학 도메인에서 LLM 회귀/예측 태스크에 적용하는 유사한 응용 사례임
기반 연구트리 탐색 디코딩의 이론적 기초를 제공한다.
기반 연구test-time scaling 및 탐색 정책의 이론적 기반을 공유한다.
후속 연구MCTS 기반 탐색 정책을 예산 제약 하에서 확장한다.
후속 연구고정 토큰 예산 하 MCTS 탐색을 확장하여 적용한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드