⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.
라이선스: OpenReview 공개(오픈액세스)
Essence
Figure 1.
이 논문은 LLM이 명시적 CoT를 요청받지 않은 중립 프롬프트 상황에서도 내재적으로 reasoning을 수행하는지 여부를 언어적·행동적·기계론적 신호를 결합한 Hidden CoT Detection Score(HCDS)로 정량화한다. Qwen3-4B Instruct와 Thinking 모델을 GSM8K, StrategyQA에서 비교해 neutral 프롬프트 행동이 explicit-CoT와 explicit-no-CoT 중 어느 쪽에 더 가까운지를 측정한다.
Motivation
Known: 기존 연구들은 explicit CoT 프롬프팅이 성능을 향상시키고 해석 가능한 reasoning step을 노출한다는 것을 보였으나(Wei et al., 2022), CoT 설명이 실제 계산 과정과 항상 일치하지 않을 수 있다는 unfaithfulness 문제도 제기되어 왔다(Turpin et al., 2023). 또한 shortcut learning을 통해 implicit reasoning이 발생할 수 있다는 점, 그리고 steerable internal feature로서 latent reasoning이 존재한다는 mechanistic 증거도 보고된 바 있다.
Gap: 기존 hidden CoT 탐지 방법은 surface-level linguistic cue나 output-only 분석에 의존하는데, 이는 상관관계일 뿐 인과관계를 보여주지 못하며, genuine reasoning과 post-hoc rationalization을 구분할 수 없다는 한계가 있다. 즉 neutral 프롬프트 하에서 모델이 실제로 latent reasoning을 수행하는지를 행동적·기계론적 증거로 판별하는 프레임워크가 부재했다.
Why: hidden CoT를 정확히 탐지하는 것은 모델이 answer를 산출할 때 내부적으로 reasoning을 수행하는지 아니면 단순히 pattern completion을 하는지를 구분하게 해주며, 이는 해석가능성과 사용자 신뢰, 그리고 explicit CoT 설명의 faithfulness 판단에 직접적으로 연결되는 중요한 문제이다.
Approach: 저자들은 explicit CoT, explicit no-CoT, neutral의 세 프롬프트 조건에서 모델 행동을 언어적(entropy), 행동적(latency, paraphrase consistency, perturbation sensitivity), 기계론적(activation/attention intervention sensitivity) 특징으로 비교하여 HCDS라는 비교 지표를 제안하고, anchor-suppression 개입 분석으로 내부 reasoning step의 인과적 기여도를 추가 검증한다.
Achievement
Figure 2. Cross-dataset HCDS replication. HCDS is positive
HCDS 지표 제안: neutral 프롬프트 행동이 explicit-CoT와 explicit-no-CoT 중 어느 쪽에 더 가까운지를 정량화하는 comparative behavioral/mechanistic score를 제안함.
Instruct 모델에서 강건한 hidden-CoT 탐지: Qwen3-4B Instruct에서 GSM8K와 StrategyQA 모두에서 HCDS가 강하게 양수(+1.87~+2.38, p<10^-9)로 나타나 가장 명확한 hidden CoT 증거를 제시함.
Thinking 모델의 prompt-invariance 발견: Qwen3-4B Thinking에서도 HCDS가 양수(+0.33~+0.60, p<0.05)이나, no-CoT 지시에도 평균 ~575 토큰의 reasoning을 생성해(Instruct의 ~24 토큰과 대조) no-CoT pole이 깨끗한 answer-only 기준선이 아님을 보임.
Anchor-suppression 메커니즘 분석: Thinking 모델은 causal load를 소수 스텝에 집중시키지 않고 여러 reasoning step에 분산시킨다는 것을 발견하여, reasoning-tuned 모델의 hidden CoT가 더 깊이 통합되고 diffuse함을 시사함.
Feature-ablation 및 length 강건성 검증: 7종의 feature ablation 변형과 짧은/중간/긴 질문 길이에 걸쳐 Instruct 효과가 강건함을 확인함.
How
Figure 3. Anchor sensitivity. anchor drop −control drop across three prompt conditions on GSM8K and StrategyQA (n=50 eac
Qwen3-4B의 Instruct와 Thinking 변형에 대해 GSM8K, StrategyQA 질문마다 explicit_cot, explicit_no_cot, neutral_strict 세 가지 프롬프트 조건으로 응답을 생성.
각 조건에서 mean token entropy, entropy slope(linguistic), latency per output token, paraphrase consistency, perturbation sensitivity(behavioral), internal activation/attention intervention sensitivity(mechanistic)로 구성된 feature vector 계산.
neutral 조건의 feature vector가 explicit-CoT와 explicit-no-CoT 조건 중 어느 쪽에 더 가까운지를 비교하여 HCDS 산출, 통계적 유의성(p-value) 검증.
anchor-suppression 개입: 특정 reasoning step(anchor)을 억제했을 때와 matched control 개입 시 answer 변화량(drop) 차이를 측정해 각 스텝의 causal contribution 평가.
출력 길이는 HCDS feature vector에는 포함하지 않고 진단·length-matched 분석 용도로만 별도 기록.
feature-ablation variant 7종과 질문 길이(short/medium/long) 별 subgroup 분석으로 robustness 검증.
Originality
hidden CoT 탐지를 output-only의 상관적 분석에서 explicit CoT/no-CoT/neutral 세 조건을 비교하는 comparative behavioral identification 문제로 재구성한 프레이밍이 참신함.
linguistic, behavioral, mechanistic 세 계열의 신호를 통합한 단일 지표(HCDS)를 제안하여 기존의 surface-level cue 기반 방법과 차별화됨.
thought anchor 개념(Bogdan et al., 2025)을 explicit CoT의 내부 구조 분석에서 neutral 프롬프트 하 latent reasoning 존재 여부 탐지로 목적을 전환하여 적용함.
Thinking 모델의 no-CoT 지시 하 토큰 생성 패턴 분석을 통해 "hidden CoT 여부"가 아닌 "prompt-invariance"라는 대안적 해석을 제시한 점이 신선함.
Limitation & Further Study
단일 모델 계열(Qwen3-4B)의 두 변형과 두 데이터셋(GSM8K, StrategyQA)에만 실험이 국한되어 일반화 가능성이 제한적임.
Thinking 모델의 경우 no-CoT 조건이 실제로 answer-only 기준선을 제공하지 못해 HCDS 해석이 모호해지며, 저자들 스스로도 이를 인정함.
anchor-suppression 분석에서 causal load가 분산된다는 결과가 다른 mechanistic interpretability 방법(예: causal mediation analysis)과 얼마나 일치하는지 추가 검증이 필요함.
후속 연구로 더 큰 모델, 더 다양한 reasoning-tuned 아키텍처, 그리고 no-CoT 조건을 강제하는 개선된 프롬프팅/디코딩 제약 기법에 대한 확장이 요구됨.
총평: explicit CoT/no-CoT/neutral 프롬프트를 비교하는 HCDS라는 새로운 지표를 통해 hidden CoT 탐지 문제를 인과적 관점으로 재구성한 흥미로운 시도이며, Thinking 모델의 prompt-invariance라는 예상치 못한 발견도 의미가 있으나, 단일 모델·소규모 데이터셋 실험이라는 한계로 추가 검증이 필요하다.
기반 연구SPECTER2 유사도 0.92로 LLM Reasoning and Safety Benchmarks와 AI-Assisted Academic Scholarly Communication가 맞닿아, 'CRITIC: Large Language Models Can Self-Correct with Tool-Interactive Critiquing'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 Scientific Information Extraction and QA가 맞닿아, 'Augmenting the veracity and explanations of complex fact checking via iterative self-revision with llms'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.