Essence
Kimi k1.5 long-CoT results.
Kimi k1.5는 Monte Carlo tree search, value function, process reward model 같은 복잡한 기법 없이, long context scaling과 개선된 policy optimization만으로 LLM에 대한 RL 학습을 확장하여 OpenAI o1급 reasoning 성능을 달성한 멀티모달 LLM이다.
Evaluation
Novelty: 4/5 Technical Soundness: 4/5 Significance: 5/5 Clarity: 4/5 Overall: 4/5
총평: MCTS나 value function 없이도 long context RL과 policy optimization만으로 OpenAI o1급 성능을 달성했다는 점에서 실용적이고 영향력 있는 기술 보고서이며, RL 기반 LLM reasoning 연구에 중요한 참조점이 될 것으로 평가된다.
같이 보면 좋은 논문
다른 접근LLM 강화학습 스케일링이라는 동일 문제를 다른 방식으로 접근함
다른 접근복잡한 트리 탐색 없이 성능을 향상시키는 대안적 방법을 제안한다.
후속 연구SPECTER2 유사도 0.93로 Reinforcement Learning Policy Optimization와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Kimi k1.5: Scaling reinforcement learning with llms'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구RL 기반 추론 성능 향상을 확장한 연구임
후속 연구장문맥과 정책 최적화를 활용한 유사한 RL 스케일링 접근을 확장한다.
후속 연구SPECTER2 유사도 0.92로 LLM Agent Reasoning Training와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Kimi k1.5: Scaling reinforcement learning with llms'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.90 기준으로 'Adaptive Joint Testing of Policies in Discounted Markov Decision Processes'의 AI4S 방법론을 'Kimi k1.5: Scaling reinforcement learning with llms'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
후속 연구SPECTER2 유사도 0.91로 Reinforcement Learning Policy Optimization와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Kimi k1.5: Scaling reinforcement learning with llms'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.92로 LLM Agent Reasoning Training와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Kimi k1.5: Scaling reinforcement learning with llms'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.