When RL Suppresses Its Own Vocabulary: Recovering Reasoning Diversity in Puzzle-to-Math Transfer

저자: Mayug Maniparambil, Arjun Karuvally, Terrence Sejnowski, Fergal Reid | 날짜: 2026 | URL: https://openreview.net/forum?id=9Snu8C81Qq 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. pass@k across the recipe. Top: held-out math benchmarks; bottom: larger held-out puzzle grids than those used

퍼즐(constraint-satisfaction puzzle)만으로 SFT와 RL(GSPO)을 수행한 7B 모델이 수학 문제를 전혀 접하지 않고도 hard-math 벤치마크에서 pass@32 capability ceiling을 크게 끌어올림을 보이고, chain-of-thought를 9종 reasoning primitive로 분해하는 분석 프레임워크를 통해 그 이유를 규명한다.

Motivation

Achievement

Figure 1

Figure 1. pass@k across the recipe. Top: held-out math benchmarks; bottom: larger held-out puzzle grids than those used

  1. Cross-domain transfer 입증: 수학 데이터 없이 퍼즐만으로 post-training한 결과 OlymMATH-Hard pass@32가 16.0%에서 36.0%로 20pp 상승(SFT +7pp, vanilla GSPO +6pp, novelty bonus +7pp)했다.
  2. Depth-recovery tradeoff 발견: primitive/motif 분석을 통해 vanilla GSPO가 COMPUTE-CHECK 체인의 깊이(depth)는 늘리지만 HYPOTHESIZE와 BACKTRACK 같은 recovery primitive를 70-80% 억제한다는 사실을 규명했다.
  3. Novelty bonus 제안 및 효과 검증: reference model 하 perplexity를 신호로 사용하는 novelty bonus가 BACKTRACK을 SFT 수준으로 복원하고 HYPOTHESIZE를 부분 복원하면서 vanilla baseline 대비 pass@32를 추가로 7pp 향상시켰으며, novelty-trained 모델만 푸는 문제에서 recovery primitive 비율이 더 높음을 확인했다.

How

Figure 2

Figure 2. Per-trace primitive counts (left) and trigram-motif counts (right) after puzzle SFT. The top row compares base

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 수학 데이터 없이 퍼즐만으로 hard-math capability ceiling을 유의미하게 확장함을 pass@32라는 엄밀한 지표로 입증하고, 그 메커니즘을 reasoning primitive 단위로 세밀하게 분석해 novelty bonus라는 실용적 해법까지 제시한 완성도 높은 워크숍 논문이다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.93로 LLM Agent Reasoning Training와 Formal Methods and Computational Reasoning가 맞닿아, 'Deepseek-prover: Advancing theorem proving in llms through large-scale synthetic data'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 LLM Agent Reasoning Training와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'DeepSeek-R1 incentivizes reasoning in LLMs through reinforcement learning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구RL과 SFT의 상호작용에 대한 기초적 분석을 제공함
기반 연구GSPO와 같은 RL 알고리즘의 이론적 토대를 제공한다.
다른 접근형식 수학 문제 해결에서 in-context learning의 한계를 다루는 대안적 접근을 제시한다.
기반 연구RL이 언어모델의 vocabulary/추론 다양성에 미치는 영향에 대한 이론적 기반을 제공한다.
기반 연구AI 기반 코딩 전략을 다른 계산적 조합론 문제로 확장한 연구이다.
기반 연구수론적 구조 문제에 생성 모델을 적용하는 유사 응용 연구이다.
기반 연구RL 기반 산술 추론의 구조적 일반화 문제를 유사한 방식으로 확장 분석한다.
다른 접근LLM의 진짜 추론 능력을 검증하는 다른 벤치마크 접근을 제시한다.
후속 연구puzzle 기반 학습이 수학적 reasoning으로 전이되는 현상을 확장하여 검증함
후속 연구capability ceiling 개선이라는 주제를 다른 벤치마크로 확장한 연구이다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드