TEMPO: Scaling Test-time Training for Large Reasoning Models

저자: Qingyang Zhang, Xinke Kong, Haitao Wu, Qinghua Hu, Minghao Wu, Baosong Yang, Yu Cheng, Yun Luo, Ganqu Cui, Changqing Zhang | 날짜: 2026 | URL: https://openreview.net/forum?id=kil5cfURcp 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. Scalable self-evolution of TEMPO on the AIME benchmark. TEMPO alternates between an E-Step (verification agent

TEMPO는 test-time training에서 policy 정제를 담당하는 reasoning agent(actor)와 labeled 데이터로 주기적 재보정되는 verification agent(critic)를 번갈아 학습시켜, 기존 단일 에이전트 self-rewarding 방식의 성능 정체와 diversity collapse 문제를 EM 알고리즘 관점에서 해결하는 dual-agent self-evolution 프레임워크이다.

Motivation

Achievement

Figure 4

Figure 4. TEMPO keeps improving. On Qwen3-14B, perfor-

  1. 성능 정체 해소 및 대폭적인 성능 향상: OLMO3-7B의 AIME 2024 정확도를 33.0%에서 51.1%로, Qwen3-14B는 42.3%에서 65.8%로 끌어올렸으며, AIME 2025에서도 각각 26.3%→37.0%, 37.1%→44.6%의 개선을 보였다.
  2. 다양성 유지: 기존 single-agent baseline(TTRL 등)이 pass@K에서 diversity collapse를 겪는 반면, TEMPO는 350 step 이상의 장기간 self-evolution에서도 높은 pass@K를 유지하며 지속적인 상승 곡선을 보였다.
  3. 이론적 통합: EM 알고리즘을 통해 기존 self-rewarding TTT 방법들이 E-step(verification)을 생략한 불완전한 EM 변형임을 규명하고, E-step 복원이 ELBO를 tighten하여 지속적 self-evolution을 가능케 함을 이론적으로 증명했다.
  4. 일반화 및 확장성: Qwen3와 OLMO3 등 다양한 모델 계열(7B, 8B, 14B)과 수학뿐 아니라 논리 퍼즐, STEM 등 비수학 추론 영역에서도 일관된 성능 향상을 확인했다.

How

Figure 2

Figure 2. TEMPO alternates between (i) Verification Agent Re-

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 단일 에이전트 self-rewarding TTT의 근본 원인을 EM 이론으로 명쾌하게 규명하고, 이를 해결하는 dual-agent 구조를 통해 실질적이고 큰 성능 향상과 다양성 보존을 동시에 달성한 설득력 있는 연구이다. 다만 labeled 데이터 의존성과 하이퍼파라미터 민감도에 대한 추가 분석이 향후 완전성을 높일 수 있을 것이다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.94로 LLM Agent Reasoning Training와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Iterative self-incentivization empowers large language models as agentic searchers'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구장문맥과 정책 최적화를 활용한 유사한 RL 스케일링 접근을 확장한다.
기반 연구SPECTER2 유사도 0.94로 LLM Agent Reasoning Training와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'PAG: Multi-Turn Reinforced LLM Self-Correction with Policy as Generative Verifier'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구검증-수정 워크플로우 강화학습의 방법론적 기초를 제공한다.
기반 연구test-time training의 이론적 기초를 제공한다.
기반 연구구조적 사전지식을 활용한 멀티에이전트 프레임워크의 유사한 적용
기반 연구reasoning agent와 verification agent 상호작용의 기초 이론 공유
다른 접근선언적/절차적 지식 상호보완 학습의 다른 접근을 제시한다.
기반 연구history-dependent threshold 개념을 확장한 연구.
다른 접근reasoning 모델 정제를 위한 다른 학습 전략을 제시한다.
다른 접근정책 정제와 검증 에이전트를 활용하는 test-time 학습의 대안적 프레임워크
다른 접근weak-to-strong oversight을 위한 다른 비판자 활용 방식 제시
후속 연구actor-critic 구조의 test-time 학습을 확장한 연구
후속 연구actor-critic 수렴 정리에 대한 이론적 배경을 공유한다.
응용 사례self-rewarding 기법의 실제 응용 사례
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드