Can A Base LLM Verify Its Own Math? A Pre-Registered Discriminator-Generator Asymmetry Test On AIME And Four Corrective Probes

저자: Ethan Y Wang, Aayan Alwani | 날짜: 2026 | URL: https://openreview.net/forum?id=SA9GNxiNGs 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. Cross-family verdict-vs-perception decomposition across the eleven-model panel. Left: Probe 1 (answer-relabele

이 논문은 base LLM이 자신의 다단계 수학 풀이(chain-of-thought)를 스스로 검증할 수 있는지를 사전등록(pre-registered) 행동 실험으로 검증하고, 실패 원인이 실험 프로토콜의 confound에 있음을 밝힌 뒤 이를 교정하는 네 가지 probe를 통해 "perception"과 "verbalization"이라는 두 별개 능력으로 분해한다.

Motivation

Achievement

Figure 1

Figure 1. Cross-family verdict-vs-perception decomposition across the eleven-model panel. Left: Probe 1 (answer-relabele

  1. 사전등록 테스트의 완전 실패 확인: Qwen2.5-1.5B base가 51개 어려운 AIME 문제에서 locked decision rule의 모든 sub-criterion을 통과하지 못함을 보였다.
  2. Confound 진단: 표준 corruption 프로토콜이 최종 답을 그대로 남겨, 테스트가 모델이 중간 추론을 실제로 읽는지 감지하지 못함을 밝혔다.
  3. Perception-verbalization 분해: 두 probe에서 perception(내적 판별 능력)은 모든 모델·문제에서 보편적으로 존재하지만, verbalization(명시적 YES/NO 판정)은 계열별로 다름을 보였다(Qwen·R1-Distill은 통과, Llama-3.1/Mistral/Gemma-2 순정 base는 실패).
  4. 개입 실험으로 인과관계 확인: 1,000예제 LoRA fine-tuning만으로 Llama-3.1-8B base의 Δverdict가 0에서 +2.67로 상승, perception은 그대로 둔 채 verbalization만 교정 가능함을 입증했다.

How

Figure 1

Figure 1. Cross-family verdict-vs-perception decomposition across the eleven-model panel. Left: Probe 1 (answer-relabele

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 사전등록 방법론과 철저한 confound 진단을 결합해 "모델은 자신의 수학을 검증할 수 없다"는 통념을 정교하게 반박하는 견고하고 참신한 실증 연구이나, 최종 self-teacher 파이프라인의 실질적 유용성 검증은 여전히 과제로 남는다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'Through the lens of core competency: Survey on evaluation of large language models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근LLM 평가의 다른 차원을 다루는 유사 연구임
기반 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Openai o1 system card'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 Formal Methods and Computational Reasoning가 맞닿아, 'The Llama 3 Herd of Models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구대규모 사전학습 모델 구축의 기초 방법론을 제공한다.
기반 연구LLM reasoning 평가의 방법론적 기반을 제공하는 선행 연구로 추정됨
다른 접근실시간 안전성 모니터링을 다른 verifier 신호 보정 방식으로 접근함
기반 연구RL 학습 후 추론 시점 성능 향상을 위한 개입 전략을 확장한 연구이다.
후속 연구LLM의 수학적 추론 검증 능력을 확장하여 분석하는 연구이다
다른 접근LLM의 자기 검증 능력을 실험적으로 평가하는 유사한 방법론을 사용한다
다른 접근verifier-free evolution 문제에 다른 다중모델 오케스트레이션 전략으로 접근한다.
다른 접근LLM API의 logprob 신뢰도 문제를 다른 통계적 방법으로 검증함
다른 접근LLM 오류 제어를 위한 다른 통계적 접근법을 제시한다.
후속 연구LLM 신뢰성 평가의 기초적 프레임워크를 제공함
후속 연구chain-of-thought 검증의 온라인 학습 이론적 틀을 제공함.
후속 연구chain-of-thought 검증 프로토콜을 확장하거나 개선하는 후속 연구로 판단됨
후속 연구token-level entropy 기반 검증 방법론의 이론적 토대 제공
후속 연구anytime-valid sequential testing의 이론적 기초를 제공한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드