Towards reasoning era: A survey of long chain-of-thought for reasoning large language models

저자: Lei Wang, Chen Ma, Xueyang Feng, Zeyu Zhang, Hao Yang, Jingsen Zhang, Zhiyuan Chen, Jiakai Tang, Xu Chen, Yankai Lin, Wayne Xin Zhao, Zhewei Wei, Ji-Rong Wen | 날짜: 2025 | DOI: N/A 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

Essence

Figure 2

Long CoT와 Short CoT의 구별: 깊은 추론(Deep Reasoning), 광범위한 탐색(Extensive Exploration), 실현 가능한 반성(Feasible Reflection)의 세 가지 핵심 특성

OpenAI-o1과 DeepSeek-R1 같은 추론 대형언어모델(RLLMs)의 성공은 장문의 체인오브쏘트(Long CoT) 특성에 기인하며, 본 논문은 Long CoT와 전통적 Short CoT의 구별, 핵심 특성, 그리고 관련 현상들에 대한 최초의 종합적 분석을 제공한다.

Motivation

Achievement

Figure 1

지난 3년간 선택된 Long CoT의 진화: 깊은 추론, 실현 가능한 반성, 광범위한 탐색의 세 가지 특성을 색상 분기로 표현

Figure 3

Long CoT의 분류법: 깊은 추론 형성(자연어, 구조화된 언어, 잠재 공간), 깊은 추론 학습(모방학습, 자기학습), 실현 가능한 반성(전체 피드백, 프로세스 피드백), 광범위한 탐색(탐색 스케일링, 내부/외부 탐색)

  1. 체계적 구별: Long CoT를 형식적으로 정의하고 Short CoT와의 차이를 수식화함.
    • Short CoT: $\text{CoT}_S = R(\{n_i\}^k_{i=1}|(k \leq B_s) \land (j=1 \Leftrightarrow \forall i \leq k, n_i \to n_{i+j}) \land (\forall i \neq j \leq k, n_i \neq n_j))$
    • Long CoT는 경계 $B_l \gg B_s$로 확장하며, 깊이 제약을 완화함
  2. 세 가지 핵심 특성 정의:
    • Deep Reasoning: 복잡한 구조 전반에서 엄밀한 논리적 분석을 수행하는 능력
    • Extensive Exploration: 평행 불확실 노드 생성 및 알려진 논리에서 미지의 논리로의 전환
    • Feasible Reflection: 논리적 연결의 피드백 및 정제
  3. 핫 현상의 체계적 분석: overthinking, inference-time scaling, "Aha Moment" 등의 출현 메커니즘 설명

How

Figure 5

깊은 추론의 세 가지 주요 형식: 자연어(CoT, MathPrompter), 구조화된 언어(PoT, CoC), 잠재 공간(Quiet-STaR, PlanningTokens)

Deep Reasoning Formation (깊은 추론 형성):

Deep Reasoning Learning (깊은 추론 학습):

Feasible Reflection (실현 가능한 반성):

Extensive Exploration (광범위한 탐색):

Originality

Limitation & Further Study

Evaluation

Novelty: 4.5/5 Technical Soundness: 4/5 Significance: 5/5 Clarity: 4/5 Overall: 4.4/5

총평: 본 논문은 RLLMs의 중심 기술인 Long CoT를 처음으로 체계적으로 분석한 중요한 종합 설문으로, 명확한 분류 체계와 풍부한 사례를 제공하여 후속 연구의 지도를 제시한다. 다만 이론적 깊이와 일부 현상의 설명이 추가 발전의 여지를 남긴다.

같이 보면 좋은 논문

기반 연구추론 모델의 CoT 메커니즘에 대한 기초적 분석을 제공한다.
기반 연구오류 정보 활용 추론 프레임워크를 확장한 연구
기반 연구RAG 시스템의 쿼리 복잡도 처리 방식을 확장한다.
다른 접근Long CoT와 Short CoT를 구분하는 다른 관점을 제시한다.
후속 연구기하 정리 증명 및 구조적 추론의 이론적 배경을 제공한다.
후속 연구SPECTER2 유사도 0.92로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Towards reasoning era: A survey of long chain-of-thought for reasoning large language models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구Long CoT 특성을 심화 분석하는 후속 연구이다.
후속 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Towards reasoning era: A survey of long chain-of-thought for reasoning large language models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구confidence 기반 answer filtering의 이론적 기반을 제공함
후속 연구SPECTER2 유사도 0.92 기준으로 'Typed Inference Dynamics: Auditable State Transitions for Mathematical Reasoning'의 AI4S 방법론을 'Towards reasoning era: A survey of long chain-of-thought for reasoning large language models'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
후속 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Towards reasoning era: A survey of long chain-of-thought for reasoning large language models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.93로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Towards reasoning era: A survey of long chain-of-thought for reasoning large language models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구RLLMs의 추론 특성을 확장하여 분석한다.
응용 사례Long CoT 특성을 실제 추론 모델에 적용한 사례를 다룬다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드