Decodable but Not Faithful: Coupling Natural-Language Rationales to Programmatic Verifiers

저자: Vatsal Ananthula, Adarsh Kumarappan | 날짜: 2026 | URL: https://openreview.net/forum?id=BAxBfSCKyj 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 5

이 논문은 자연어 rationale의 hidden state가 programmatic verifier(정리 증명기, 바둑 엔진, 코드 실행기, 사실 검증 라벨)의 출력을 예측하도록 훈련하는 verifier-coupled reasoning 프레임워크를 제안하고, 이러한 decodability(디코딩 가능성)가 높아져도 생성된 설명의 faithfulness(충실성)를 보장하지 않는다는 핵심적인 간극을 다섯 개 도메인에서 실증한다.

Motivation

Achievement

Figure 7
  1. Decodability-Faithfulness Gap 규명: LeanCheck와 KataGo에서는 rationale-only/proof-only pooling이 counterfactual conflict 하에서도 완벽한 방향성 분리(perfect directional separation) 및 81% 정확도의 10-way win-rate bucket 인코딩을 달성했지만, 코드 설명 설정에서는 98.6% coupling에도 불구하고 생성된 설명이 무관한 알고리즘을 기술하는 등 완전히 unfaithful했다.
  2. Capacity-artifact 배제: pretrained GPT-2와 from-scratch 모델을 통제 비교하여 이 간극이 모델 용량(capacity) 문제가 아니라 구조적(structural) 문제임을 입증했다.
  3. Causal 영향 확인: synthetic activation patching을 통해 rationale representation이 실제로 claim logit에 causal한 영향(73-89% vs. 31% baseline)을 미침을 확인했다.
  4. FEVER를 통한 evidence sensitivity 분리: evidence-only pooling이 raw accuracy를 희생하는 대신 genuine evidence sensitivity를 고립시켜 보여준다.
  5. Fine-grained vs binary claim 분석: consistency loss가 binary claim보다 fine-grained claim에 불균형적으로 더 큰 이득을 준다는 것을 per-claim 분석으로 밝혔다.

How

Figure 3

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: probe accuracy나 representation coupling을 faithful reasoning의 근거로 오인하는 관행에 경종을 울리는 중요하고 시의적절한 연구이며, 다양한 도메인에 걸친 diagnostic ladder 설계가 특히 인상적이다. 다만 gap을 해소하는 구체적 방법론 제시보다는 현상 규명에 초점이 맞춰져 있어 후속 연구로의 확장이 기대된다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.94로 Formal Proof Verification Automation와 Scientific Information Extraction and QA가 맞닿아, 'Fact-checking complex claims with program-guided reasoning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.94로 Formal Proof Verification Automation와 Formal Methods and Computational Reasoning가 맞닿아, 'Towards large language models as copilots for theorem proving in lean'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.94로 Formal Proof Verification Automation와 Formal Methods and Computational Reasoning가 맞닿아, 'Lean-star: Learning to interleave thinking and proving'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구환각 탐지 방법을 실제 응용 시나리오에 적용한다.
기반 연구LLM 기반 정리 증명기의 symmetry 문제를 확장하여 다루는 연구
기반 연구LLM 기반 정형화 검증을 실제 수학 증명에 적용한 사례이다.
기반 연구informal-to-formal proof 변환 과정을 확장한 연구이다.
기반 연구Lean grind 자동화의 실제 적용 사례를 공유한다.
기반 연구LLM 에이전트를 실제 알고리즘 설계 문제에 적용한 사례이다.
다른 접근자연어 수학 증명 검증을 위한 다른 생성적 검증 방법을 제시한다.
후속 연구verifier-coupled reasoning 개념을 확장한 연구
다른 접근구조화된 데이터를 텍스트로 변환하는 다른 책임 분할 전략을 제시한다.
다른 접근autoformalization 평가를 위한 유사하지만 다른 벤치마크 설계를 제시하는 연구로 보임
다른 접근rationale faithfulness 문제를 다른 방식으로 다룸
후속 연구structured prompting을 통한 정형 증명 생성의 이론적 기반
다른 접근자연어 rationale의 신뢰성을 검증하는 다른 접근을 제시한다.
후속 연구생성 모델의 분포 붕괴 현상에 대한 이론적 formalize를 기반으로 한다.
후속 연구typed state transition 시스템 설계의 이론적 기초를 공유한다.
후속 연구programmatic verifier와 언어 모델 결합 아이디어를 확장한 연구이다.
후속 연구Lean 형식 검증기를 활용한 보상 설계의 기초적 방법론을 제공한다.
반론/비판narrative 생성 중심 접근에 대한 비판적 관점을 제공한다.
반론/비판headline metric의 불투명성을 지적하는 유사한 비판적 관점을 공유한다.
반론/비판rationale의 faithfulness 문제와 대비되는 구조화 접근을 제시함
반론/비판rationale의 신뢰성에 대한 상반된 관점을 제시함
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드