PaSa: An LLM Agent for Comprehensive Academic Paper Search

저자: Yichen He, Guanhua Huang, Peiyuan Feng, Yuan Lin, Yuchen Zhang, Hang Li, Weinan E | 날짜: 2025 | DOI: N/A 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

Essence

Figure 1

PaSa 시스템 아키텍처: Crawler와 Selector 두 개의 LLM 에이전트로 구성

PaSa는 복잡한 학술 논문 검색을 자동으로 수행하는 LLM 기반 에이전트로, 검색 도구 활용, 논문 읽기, 인용 네트워크 탐색을 통해 종합적이고 정확한 검색 결과를 제공한다. 합성 데이터(AutoScholarQuery)로 학습했음에도 실제 환경(RealScholarQuery)에서 Google Scholar 및 GPT-4o 기반 방법들을 크게 능가한다.

Motivation

Achievement

Figure 2

PaSa 워크플로우 예시: Crawler의 다양한 [Search] 실행과 인용 네트워크 탐색

  1. 성능 우수성: PaSa-7B는 AutoScholarQuery 테스트 셋에서 Google+GPT-4o 대비 Recall@20에서 34.05%, Recall@50에서 39.36% 향상. RealScholarQuery에서는 Recall@20 37.78%, Recall@50 39.90% 향상. PaSa-GPT-4o 대비 30.36% 재현율 향상.
  2. 합성 데이터의 효과성: 합성 데이터(AutoScholarQuery, 33.5k 쿼리-논문 쌍)로만 학습했음에도 실제 환경에서 우수한 성능 달성, 도메인 전이(domain transfer) 가능성 입증.
  3. 고품질 벤치마크 구축: 실제 연구자 50명의 쿼리로 구성된 RealScholarQuery 벤치마크 개발으로 현실적 평가 환경 제공.

How

Originality

Limitation & Further Study

Evaluation

Novelty: 4.5/5 Technical Soundness: 4.5/5 Significance: 4.5/5 Clarity: 4/5 Overall: 4.25/5

총평: PaSa는 LLM 에이전트를 활용한 학술 논문 검색 문제의 창의적인 해법이며, 합성 데이터로의 학습이 실제 환경에서 우수한 성능을 달성하는 점이 주목할 만하다. 다만 데이터의 도메인 편향성과 평가 규모의 제한이 일반화 가능성에 대한 의문을 남긴다.

같이 보면 좋은 논문

기반 연구검색 증강 언어 모델을 실제 few-shot 태스크에 적용한 사례를 다룬다.
기반 연구인용 네트워크 탐색 기반 검색 에이전트 설계의 방법론적 토대를 제공한다.
다른 접근PaperQA와 유사하게 학술 문헌 탐색 및 질의응답을 수행하는 에이전트 시스템이다.
다른 접근학술 논문 검색을 위한 LLM 에이전트 기반의 대안적 접근
다른 접근대규모 과학 문헌 처리를 위한 다른 RAG 시스템 접근을 다룬다.
다른 접근학술 검색 자동화를 위한 다른 LLM 에이전트 접근법
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드