Universal Reasoner: A Single, Composable Plug-and-Play Reasoner for Frozen LLMs

저자: Jaemin Kim, Hangeol Chang, Hyunmin Hwang, Choonghan Kim, Jong Chul Ye | 날짜: 2026 | URL: https://openreview.net/forum?id=JheeAwquCb 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. UniR Framework Overview. Our approach trains a lightweight, transferable reasoning module (πr) using predefine

UniR은 verifiable reward를 이용해 별도의 경량 reasoning module(πr)을 policy gradient로 학습한 뒤, 추론 시 frozen backbone LLM(πb)의 logit에 단순히 더하는 방식으로 reasoning 능력을 부여하는 plug-and-play 프레임워크이다. 이 additive 구조 덕분에 모델 크기 간 transfer(weak-to-strong)와 여러 reasoning module의 조합(composability)이 가능하다.

Motivation

Achievement

Figure 2

Figure 2. Effectiveness of Reasoning module Transfer. Results demonstrate that a trained reasoning module can improve pe

  1. Transferability: 3B backbone과 함께 학습된 1.5B reasoning module이 별도 튜닝 없이 14B backbone에도 적용되어 성능을 향상시킴 (weak-to-strong generalization).
  2. Composability: 서로 다른 태스크(예: 수학 reasoning과 번역, 혹은 비전-언어 reasoning과 의료 reasoning)에 대해 학습된 여러 reasoning module을 logit 합산만으로 결합해 복합적 reasoning을 수행할 수 있음을 보임.
  3. Superior Performance: 수학 reasoning, 기계 번역, 의료 reasoning, 그리고 vision-language 벤치마크에서 기존 fine-tuning 및 PEFT 기반 방법을 능가하는 성능을 달성.

How

Figure 1

Figure 1. UniR Framework Overview. Our approach trains a lightweight, transferable reasoning module (πr) using predefine

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: reward를 token-level logit guidance로 분해해 별도의 경량 모듈로 학습하고 frozen backbone에 additive하게 결합한다는 아이디어는 간단하면서도 강력하며, weak-to-strong transfer와 modular composability를 동시에 실현한 점이 인상적인 연구이다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.92로 LLM Agent Reasoning Training와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Curriculum Reinforcement Learning from Easy to Hard Tasks Improves LLM Reasoning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.92로 LLM Agent Reasoning Training와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Kimi k1.5: Scaling reinforcement learning with llms'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구frozen backbone에 reasoning을 결합하는 이론적 토대를 제공한다.
기반 연구policy gradient 기반 reasoning 학습의 이론적 토대를 제공한다.
다른 접근다른 방식으로 LLM의 추론 능력을 향상시키는 대안적 접근을 다룬다.
다른 접근LLM에 경량 모듈을 추가해 추론 능력을 부여하는 유사한 plug-and-play 접근을 제시한다.
후속 연구policy gradient 기반 reasoning module 학습 방식을 확장한다.
후속 연구frozen backbone에 reasoning 능력을 추가하는 방법을 확장한다.
후속 연구frozen backbone에 logit 추가 방식을 확장한 추론 능력 강화 기법이다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드