/Users/jehyunlee/Documents/내노트북/paper-curation/docs/papers/449_Kimi_k15_Scaling_reinforcement_learning_with_llms


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

Essence

Figure 1

Kimi k1.5 long-CoT results.

Kimi k1.5는 Monte Carlo tree search, value function, process reward model 같은 복잡한 기법 없이, long context scaling과 개선된 policy optimization만으로 LLM에 대한 RL 학습을 확장하여 OpenAI o1급 reasoning 성능을 달성한 멀티모달 LLM이다.

Motivation

Achievement

Figure 1

Kimi k1.5 long-CoT results.

  1. State-of-the-art long-CoT 성능: AIME 77.5, MATH 500 96.2, Codeforces 94th percentile, MathVista 74.9로 OpenAI o1과 대등한 성능을 달성했다.
  2. State-of-the-art short-CoT 성능: AIME 60.8, MATH500 94.6, LiveCodeBench 47.3으로 GPT-4o, Claude Sonnet 3.5 등 기존 short-CoT 모델을 최대 +550% 능가했다.
  3. Long context RL scaling 효과 입증: RL context window를 128k까지 확장하며 partial rollout 기법으로 학습 효율을 유지하면서 context 길이 증가에 따른 지속적 성능 향상을 관찰했다.
  4. Simplistic RL 프레임워크 확립: MCTS, value function, process reward model 없이도 long context와 policy optimization만으로 강력한 reasoning 성능을 얻을 수 있음을 보였다.
  5. 효과적인 long2short 전이 기법: length penalty와 model merging을 통해 long-CoT의 추론 능력을 short-CoT 모델로 효율적으로 이식했다.

How

Figure 3

Large Scale Reinforcement Learning Training System for LLM

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 5/5 Clarity: 4/5 Overall: 4/5

총평: MCTS나 value function 없이도 long context RL과 policy optimization만으로 OpenAI o1급 성능을 달성했다는 점에서 실용적이고 영향력 있는 기술 보고서이며, RL 기반 LLM reasoning 연구에 중요한 참조점이 될 것으로 평가된다.

같이 보면 좋은 논문

다른 접근LLM 강화학습 스케일링이라는 동일 문제를 다른 방식으로 접근함
다른 접근복잡한 트리 탐색 없이 성능을 향상시키는 대안적 방법을 제안한다.
후속 연구SPECTER2 유사도 0.93로 Reinforcement Learning Policy Optimization와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Kimi k1.5: Scaling reinforcement learning with llms'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구RL 기반 추론 성능 향상을 확장한 연구임
후속 연구장문맥과 정책 최적화를 활용한 유사한 RL 스케일링 접근을 확장한다.
후속 연구SPECTER2 유사도 0.92로 LLM Agent Reasoning Training와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Kimi k1.5: Scaling reinforcement learning with llms'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.90 기준으로 'Adaptive Joint Testing of Policies in Discounted Markov Decision Processes'의 AI4S 방법론을 'Kimi k1.5: Scaling reinforcement learning with llms'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
후속 연구SPECTER2 유사도 0.91로 Reinforcement Learning Policy Optimization와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Kimi k1.5: Scaling reinforcement learning with llms'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.92로 LLM Agent Reasoning Training와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Kimi k1.5: Scaling reinforcement learning with llms'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드