Iterative self-incentivization empowers large language models as agentic searchers

저자: Zhengliang Shi, Lingyong Yan, Dawei Yin, Suzan Verberne, Maarten de Rijke, Zhaochun Ren | 날짜: 2025 | DOI: arXiv:2505.20128 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

Essence

Figure 2

그림 2: EXSEARCH의 Expectation-Maximization 프로세스 개요. E-step에서는 탐색 궤적을 샘플링하고 가중치를 할당하며, M-step에서는 재가중치 손실함수로 LLM을 학습시킨다.

본 논문은 대규모 언어모델(LLM)을 정보 검색 에이전트로 자동 개선하는 자기-인센티브화 기반 탐색 프레임워크(EXSEARCH)를 제안한다. 일반화 EM 알고리즘을 통해 검색 궤적을 잠재변수로 취급하고, LLM이 생성한 데이터로부터 반복적으로 학습하는 자기 루프를 형성한다.

Motivation

Achievement

Figure 1

그림 1: HotpotQA 데이터셋에서 다양한 LLM에 EXSEARCH를 적용한 성능. 여러 모델과 스케일에서 안정적인 수렴을 보임.

  1. 성능 향상: 4개 지식 집약적 벤치마크에서 강력한 베이스라인 대비 정확 일치도(Exact Match) 7.8% 향상 달성
  2. 수렴 이론 보장: 자기-인센티브화 훈련 프로세스의 수렴성을 이론적으로 증명하여 안정성 보장
  3. 확장성 검증: EXSEARCH-Zoo를 통해 다양한 백본 LLM(LLaMA, Qwen, Mistral) 및 모델 규모(3B~24B)에서 일관된 효과 입증
  4. 통합 프레임워크: 동적 문서 검색, 증거 추출, 답변 생성을 단일 LLM으로 통합하여 end-to-end 최적화 실현

How

Figure 2

핵심 방법론:

$$p(z | x; \theta) = \prod_{i=1}^{|z|} p(x_i | x, z_{<i}; \theta) \cdot p(e_i | x_i, R(x_i); \theta)$$

$$w(z) \propto p(y | x, z; \theta_t)$$

(궤적이 정답을 얼마나 잘 지원하는지 반영)

$$\max_\theta \mathbb{E}_{z \sim p(z|x;\theta_t)} [w(z) \log p(z|x;\theta) + w(z) \log p(y|x,z;\theta)]$$

여기서 첫 항은 검색 학습(L_R), 두 번째 항은 답변 생성 학습(L_A)을 담당

Originality

Limitation & Further Study

Evaluation

Novelty: 4.5/5 Technical Soundness: 4.5/5 Significance: 4.5/5 Clarity: 4/5 Overall: 4.3/5

총평: EXSEARCH는 LLM 기반 정보 검색 에이전트를 자기-인센티브화된 자기 개선 루프로 학습하는 이론적으로 견고한 프레임워크를 제시하며, 지식 집약적 작업에서 일관된 성능 향상을 보여준다. 다만 계산 효율성 개선과 더 광범위한 작업 영역 검증이 이루어진다면 더 강력한 기여가 될 수 있다.

같이 보면 좋은 논문

기반 연구LLM 검색 에이전트 학습의 기초 방법론을 제공함
기반 연구LLM 강화학습 기반 추론 성능 향상의 이론적 토대를 제공한다.
다른 접근유사한 자기 학습 프레임워크를 다른 방식으로 구현한다.
다른 접근정보 검색 에이전트 개선이라는 동일 문제를 다른 방식으로 접근함
후속 연구자기 인센티브화 검색 프레임워크를 확장한 연구임
후속 연구SPECTER2 유사도 0.91로 Clinical Time-Series Modeling와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Iterative self-incentivization empowers large language models as agentic searchers'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.92로 Clinical Time-Series Modeling와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Iterative self-incentivization empowers large language models as agentic searchers'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.93로 LLM Agent Reasoning Training와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Iterative self-incentivization empowers large language models as agentic searchers'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구자기 개선 루프를 활용한 LLM 훈련 방법을 확장한다.
후속 연구SPECTER2 유사도 0.91로 Clinical Time-Series Modeling와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Iterative self-incentivization empowers large language models as agentic searchers'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.90로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Iterative self-incentivization empowers large language models as agentic searchers'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구LLM을 반복적 자기개선 루프로 검색 에이전트화하는 self-incentivization 프레임워크가 PaSaMaster의 recursive self-evolving 설계에 기반이 된다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드