⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.
라이선스: OpenReview 공개(오픈액세스)
Essence
Figure 1. pass@k across the recipe. Top: held-out math benchmarks; bottom: larger held-out puzzle grids than those used
퍼즐(constraint-satisfaction puzzle)만으로 SFT와 RL(GSPO)을 수행한 7B 모델이 수학 문제를 전혀 접하지 않고도 hard-math 벤치마크에서 pass@32 capability ceiling을 크게 끌어올림을 보이고, chain-of-thought를 9종 reasoning primitive로 분해하는 분석 프레임워크를 통해 그 이유를 규명한다.
Motivation
Known: RLVR(RL with verifiable rewards)은 GRPO, GSPO, DAPO 등의 objective를 통해 LLM reasoning 성능을 향상시키는 표준 post-training 레시피로 자리잡았으며, 합성 퍼즐 데이터를 이용한 학습이 수학 reasoning으로 전이(transfer)된다는 보고들(Enigmata, Logic-RL, LogicPuzzleRL)이 존재한다.
Gap: 기존 연구들은 SFT/RL 데이터에 수학 문제를 섞어 학습시키거나(Enigmata), pass@1 기준의 비교적 쉬운 math 벤치마크(AIME24 이하)에서만 평가하여, RL이 실제로 capability ceiling을 확장하는지 아니면 이미 도달 가능한 solution path를 sharpening하는 것인지 구분하지 못했다.
Why: post-training 데이터에서 수학을 완전히 배제한 채 순수 퍼즐만으로 hard-math 성능 향상을 입증하면, RL이 domain-specific pattern이 아닌 범용적인 problem-solving operation(search, planning, verification, backtracking)을 학습·전이시킨다는 강력한 증거가 되며, 이는 RLVR의 일반화 메커니즘 이해와 데이터 효율적인 reasoning 모델 훈련에 중요한 함의를 갖는다.
Approach: 저자들은 OLMo3-7B-Instruct-SFT 모델에 Simon Tatham 퍼즐 컬렉션만으로 SFT와 GSPO 기반 RL을 순차 적용하고, chain-of-thought를 9-class span classifier와 motif extraction으로 분해하는 분석 프레임워크를 도입해 학습 단계별 reasoning primitive 변화를 추적한 뒤, RL이 억제하는 exploratory primitive를 복원하기 위한 perplexity 기반 novelty bonus를 제안한다.
Achievement
Figure 1. pass@k across the recipe. Top: held-out math benchmarks; bottom: larger held-out puzzle grids than those used
Cross-domain transfer 입증: 수학 데이터 없이 퍼즐만으로 post-training한 결과 OlymMATH-Hard pass@32가 16.0%에서 36.0%로 20pp 상승(SFT +7pp, vanilla GSPO +6pp, novelty bonus +7pp)했다.
Depth-recovery tradeoff 발견: primitive/motif 분석을 통해 vanilla GSPO가 COMPUTE-CHECK 체인의 깊이(depth)는 늘리지만 HYPOTHESIZE와 BACKTRACK 같은 recovery primitive를 70-80% 억제한다는 사실을 규명했다.
Novelty bonus 제안 및 효과 검증: reference model 하 perplexity를 신호로 사용하는 novelty bonus가 BACKTRACK을 SFT 수준으로 복원하고 HYPOTHESIZE를 부분 복원하면서 vanilla baseline 대비 pass@32를 추가로 7pp 향상시켰으며, novelty-trained 모델만 푸는 문제에서 recovery primitive 비율이 더 높음을 확인했다.
How
Figure 2. Per-trace primitive counts (left) and trigram-motif counts (right) after puzzle SFT. The top row compares base
Base model: OLMo3-7B-Instruct-SFT (사전 RL 미적용, upstream 수학 지식 보유)
Post-training 데이터: Simon Tatham 컬렉션의 Bridges, Pattern, Undead, Galaxies 퍼즐만 사용 (SFT, RL 모두 수학 문제 미포함)
평가: OlymMATH-Hard, HMMT, OMEGA 등 saturation과 거리가 먼 hard math 벤치마크에서 32-rollout, T=0.6으로 pass@32 측정 (capability ceiling 확장 여부를 보기 위해 pass@1 대신 pass@32 사용)
분석 프레임워크: judge annotation을 distill한 lightweight 9-class span classifier로 chain-of-thought를 HYPOTHESIZE, COMPUTE, CHECK, BACKTRACK, PLAN, ENUMERATE, SETUP, SUMMARIZE, OTHER로 분할하고 trigram 등 motif extraction으로 반복 패턴을 정량화하여 학습 단계별/도메인별 primitive 분포 변화를 추적
RL 알고리즘: GSPO 기반, vanilla 버전과 perplexity 기반 novelty bonus(정답 rollout 중 frozen reference model 하에서 낮은 확률을 갖는, 즉 novel한 rollout에 추가 보상)를 적용한 버전을 비교
Originality
수학 문제를 SFT/RL 어디에도 포함시키지 않는 깔끔한 isolation 설계로 RL의 순수 전이 효과를 분리해낸 최초의 실험 설정
pass@1이 아닌 pass@32(대규모 k) 지표를 사용해 capability ceiling 확장과 path sharpening을 구분한 평가 방법론
chain-of-thought를 9-class primitive + motif(trigram) 단위로 분해하는 경량 span classifier 기반 분석 프레임워크로 대규모(25k-token traces, 수만 rollout, 10 checkpoint) 분석을 가능케 함
perplexity(under frozen reference model) 기반 novelty bonus를 도입해 현재 policy가 아닌 고정된 reference 모델을 anchor로 삼아 diversity target이 학습 중 drift하지 않도록 설계, top-k token NLL 사용으로 LLM-judge 클러스터링 없이 verifier-correct rollout에만 적용
Limitation & Further Study
단일 7B 모델(OLMo3-7B-Instruct-SFT)과 특정 퍼즐 세트(Simon Tatham 4종)에 국한된 실험으로, 다른 모델 규모나 퍼즐 도메인으로의 일반화는 추가 검증이 필요함
novelty bonus가 HYPOTHESIZE를 "부분적으로만" 복원한다고 명시되어 있어 완전한 depth-recovery tradeoff 해결에는 이르지 못함
9-class span classifier가 judge annotation을 distill한 것으로, classifier 자체의 오류나 편향이 motif 분석 결과에 영향을 줄 수 있음
pass@32라는 대규모 샘플링 지표는 계산 비용이 크며, 실제 서비스 환경에서의 pass@1 개선 효과나 효율성에 대한 논의가 제한적
향후 연구로 다양한 모델 크기·퍼즐 도메인·다른 novelty 신호(예: 다른 reference model 선택)에 대한 ablation, 그리고 완전한 recovery primitive 복원을 위한 개선된 보상 설계가 필요
총평: 수학 데이터 없이 퍼즐만으로 hard-math capability ceiling을 유의미하게 확장함을 pass@32라는 엄밀한 지표로 입증하고, 그 메커니즘을 reasoning primitive 단위로 세밀하게 분석해 novelty bonus라는 실용적 해법까지 제시한 완성도 높은 워크숍 논문이다.