Essence
Figure 1. The JURY-RL workflow: Votes Propose, Proofs Dispose. For each problem, a majority vote from multiple rollouts
JURY-RL은 label-free RLVR에서 다수결 투표(voting)로 후보 답안을 제안하고 Lean 정형 검증기가 보상을 최종 결정하는 방식으로, 검증이 불확실할 때는 ResZero라는 zero-mean, variance-preserving fallback 보상을 사용해 학습 안정성과 정답 정합성을 동시에 확보한다.
Evaluation
Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5
총평: 투표와 정형 검증을 분리하는 아이디어와 ResZero fallback 설계가 label-free RLVR의 안정성과 정답 정합성 문제를 실용적으로 해결한 인상적인 워크숍 논문이며, 다만 Lean 의존성으로 인한 도메인 일반화 한계는 추가 검증이 필요하다.
같이 보면 좋은 논문
기반 연구SPECTER2 유사도 0.94로 LLM Agent Reasoning Training와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Large language models can self-improve'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 LLM Agent Reasoning Training와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Seed-coder: Let the code model curate data for itself'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 LLM Agent Reasoning Training와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'AI Copilot Code Quality: 2025 Data Suggests 4x Growth in Code Clones - GitClear'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구Bayesian inference 기반 chain-of-thought를 확장한 연구로 추정됨
기반 연구RLVR의 보상 게이팅 메커니즘에 대한 기초 연구
기반 연구Lean 형식 검증기를 활용한 보상 설계의 기초적 방법론을 제공한다.
기반 연구LLM 채점 시스템을 실제 대학 강의에 확장 적용
다른 접근검증 불확실성 처리를 위한 다른 fallback 보상 전략을 제시한다.
다른 접근유사한 오픈소스 과학 추론 VLM을 다른 학습 전략으로 구축함
후속 연구다수결 투표 기반 후보 제안 방식을 확장하여 적용한 후속 연구이다.
다른 접근label-free RLVR라는 동일 문제를 다른 검증 메커니즘으로 해결한다.
다른 접근label-free RLVR을 위한 다른 검증 기반 보상 설계
다른 접근수학 추론 시 시간 예산 활용의 다른 접근을 다룬다.
다른 접근다른 과학 도메인에서 (M)LLM의 인간 대비 추론 능력을 평가한다.
다른 접근수학 솔버 성능 검증에 대한 다른 통계적 접근법을 제시한다.
다른 접근회귀 기반 query function 탐색을 위한 다른 방법론을 사용함
후속 연구다수결 투표 기반 후보 제안 방식을 확장하는 연구이다.
후속 연구다수결 투표와 형식 검증 결합 방식을 확장한 연구
후속 연구DPO 기반 학습의 기초 방법론을 공유한다.
반론/비판confidence 기반 선택의 유효성에 대해 상반된 결과를 제시할 수 있다.