How
Figure 2: PPO vs GRPO 수렴 비교
RL 객체 함수 (검색 엔진 통합):
- 정책 LLM πθ가 입력 x에서 검색 엔진 R과의 상호작용을 포함한 출력 y 샘플링
- KL 발산으로 참조 정책으로부터의 편향 제어
핵심 기술:
- 손실 마스킹: 검색된 토큰(I(yt)=0)은 정책 그래디언트 계산에서 제외, LLM 생성 토큰만 최적화
- PPO 적용: 식 (2)에서 클리핑된 정책 비율을 사용한 제약된 목적 함수
```
J_PPO(θ) = min(πθ/π_old · A, clip(πθ/π_old, 1-ε, 1+ε) · A)
```
- GRPO 적용: 그룹 상대 정책 최적화로 비평가 모델 제거, 그룹 점수에서 베이스라인 추정
- 토큰 구조:
<search> </search>로 검색 쿼리, <information> </information>으로 검색 결과, <think> </think>로 추론, <answer> </answer>로 최종 답변 감싸기
- 보상 함수: 결과 기반 보상(rϕ)만 사용 (과정 기반 보상 미사용)
Figure 3: 검색된 토큰 손실 마스킹 연구
Evaluation
Novelty: 4.5/5 Technical Soundness: 4/5 Significance: 4.5/5 Clarity: 4/5 Overall: 4.2/5
총평: Search-R1은 검색 엔진 호출을 RL 최적화에 체계적으로 통합한 실용적 프레임워크로, 강력한 실험 결과와 구현 상세함이 강점이나, 이론적 깊이와 계산 효율성에 대한 추가 분석이 요구된다.
같이 보면 좋은 논문
기반 연구RAG 및 검색 통합의 기초적 방법론을 제공한다.
기반 연구LLM의 검색 추론 능력을 강화학습으로 확장함
다른 접근LLM의 검색 능력 강화라는 동일 목표를 다른 RL 기법으로 접근한다.
기반 연구검색 엔진 활용 추론에 자기비판 메커니즘을 추가하여 확장한다.
후속 연구검색 기반 추론에 자기비판 피드백을 추가하여 확장한 연구이다.
다른 접근LLM의 검색 활용 능력을 다른 방식으로 향상시키는 접근이다.
다른 접근멀티모달 모델에서 시각 토큰의 중요도를 평가하고 선택적으로 처리하는 유사한 문제를 다룸
후속 연구인용 네트워크 탐색 기반 검색 에이전트 설계의 방법론적 토대를 제공한다.
후속 연구SPECTER2 유사도 0.93로 LLM Agent Reasoning Training와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.91로 Multimodal Biomedical Data Fusion와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구Search-R1의 강화학습 접근을 확장한 연구이다.
후속 연구SPECTER2 유사도 0.93로 LLM Agent Reasoning Training와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
응용 사례RL 기반 검색 증강 추론을 실제 QA 작업에 적용한다.