Essence
Figure 1. A-RL i.i.d. sampling flatlines at 42/244 from k=32 on-
RL로 학습된 Lean 정리 증명기(theorem prover)가 추론 시점에서 mode collapse를 일으켜 i.i.d. 샘플링 예산을 늘려도 성능이 정체되는 현상을 진단하고, 고정된 tactic skeleton 스케줄을 프롬프트에 주입하는 단순한 개입으로 이 정체를 깨뜨릴 수 있음을 실증적으로 보인 진단 연구이다.
Evaluation
Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5
총평: RL-trained Lean prover의 inference-time mode collapse를 명확한 실험 설계와 통제된 ablation으로 진단하고, 저비용의 구조적 개입이 이를 완화할 수 있음을 설득력 있게 보인 견실한 진단 연구이나, 벤치마크와 모델 규모의 제한성으로 일반화에는 추가 검증이 필요하다.
같이 보면 좋은 논문
기반 연구SPECTER2 유사도 0.94로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Towards large language models as copilots for theorem proving in lean'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.94로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Deepseek-prover: Advancing theorem proving in llms through large-scale synthetic data'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.94로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Lean-star: Learning to interleave thinking and proving'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구구조적 사전(prior)을 활용한 추론 능력 향상 연구로 확장된 관계를 가진다.
기반 연구온라인 학습 이론을 LLM 검증 실제 문제에 적용함.
기반 연구mode collapse 및 샘플링 다양성 문제에 대한 이론적 배경을 제공한다.
다른 접근reasoning 과정의 온라인 모니터링이라는 유사한 목표를 가진 연구이다.
기반 연구과학적 에이전트에 형식 검증을 적용한 사례
기반 연구Lean 정리 증명기 RL 학습의 이론적 배경을 제공.
후속 연구autoformalization의 정확도 평가 방법론에 대한 토대를 제공한다.
기반 연구capability ceiling 개선이라는 주제를 다른 벤치마크로 확장한 연구이다.
기반 연구formal-math 도메인에 대한 agentic training의 응용 사례이다.
기반 연구LLM의 수학적 추론 검증 능력을 확장하여 분석하는 연구이다
후속 연구RL 학습 후 추론 시점 성능 향상을 위한 개입 전략을 확장한 연구이다.
기반 연구harness 엔지니어링 개념을 실제 진화적 알고리즘 발견에 적용한다.
기반 연구coding agent의 formalization 검증 게이트를 확장하는 연구
후속 연구inference-time diversity 기법을 확장한 후속 연구.
기반 연구Mathlib 증명 분석을 자기지도학습에 적용한 유사 연구이다.
기반 연구LLM 기반 연구 방향 제안을 확장한 형태이다.
응용 사례RL 학습된 추론 모델의 샘플링 전략을 실제 정리 증명 태스크에 적용한다.
다른 접근model collapse 현상을 설명하는 다른 이론적 프레임워크이다
다른 접근정리 증명 및 검증을 위한 대규모 스케일링 접근을 공유함
다른 접근LLM 기반 정리 증명에서 다른 탐색 전략을 사용하는 대안적 접근이다.
다른 접근에이전트 신뢰성 검증에 대한 다른 구조적 접근법을 제시하는 것으로 추정된다.
다른 접근RL 기반 추론 모델의 다양성 저하 문제를 다른 방식으로 완화하는 접근이다.
다른 접근수학적 추론 검증을 위한 다른 self-verification 접근법
다른 접근LLM sycophancy 측정을 위한 다른 벤치마크 접근법
다른 접근어려운 수학 문제 해결을 위한 RL 훈련의 다른 접근법으로 보임.
후속 연구compositional structure 학습의 이론적 기반을 제공한다.
후속 연구olympiad 수준 formal theorem proving 모델의 기반 연구이다.
후속 연구정리 증명기의 대칭성 문제를 다루는 이론적 기반 연구이다.
후속 연구MDP 기반 추론 모델링의 이론적 토대를 제공하는 선행 연구임
후속 연구coarse-to-refined RL 단계 설계의 이론적 토대를 제공하는 선행 연구이다.
후속 연구symbolic proof sketch를 실행 가능한 증명으로 변환하는 방법론적 기반을 공유한다.
후속 연구conformal risk control 방법론의 이론적 기반을 제공한다.
후속 연구수학 추론 벤치마크 평가의 기초 연구
후속 연구distribution-aware program learning의 방법론적 기초를 제공한다.