ScholarSearch: Benchmarking Scholar Searching Ability of LLMs

저자: Junting Zhou, Wang Li, Yiyan Liao, Nengyuan Zhang, Tingjia Miao, Zhihui Qi, Yuhan Wu, Tong Yang | 날짜: 2025 | DOI: 10.48550/ARXIV.2506.13784 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

Essence

Figure 1

Figure 1: The data collection pipeline of ScholarSearch. Data sourced by students from academic publications or websites

본 논문은 학술 검색 분야에서 LLM의 능력을 평가하기 위해 ScholarSearch라는 새로운 벤치마크 데이터셋을 제안한다. 기존 BrowseComp 등의 벤치마크는 일반적 검색에 초점을 맞추고 있어서 학술적 검색의 복잡한 요구사항을 충분히 다루지 못하므로, 이를 해결하기 위해 223개의 고품질 질문으로 구성된 데이터셋을 개발했다.

Motivation

Achievement

Figure 1

Figure 1: The data collection pipeline of ScholarSearch. Data sourced by students from academic publications or websites

How

Figure 1

Figure 1: The data collection pipeline of ScholarSearch. Data sourced by students from academic publications or websites

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: ScholarSearch는 학술 정보 검색이라는 중요하지만 미충족된 평가 영역을 처음으로 체계적으로 다룬 의미있는 기여이다. 엄격한 데이터 구축 방법론과 Academic Practicality, High Difficulty 등의 명확한 설계 목표가 강점이다. 다만 데이터셋 규모, 구체적인 평가 메트릭 제시, 그리고 기존 LLM들의 성능 분석이 보충될 필요가 있다.

같이 보면 좋은 논문

기반 연구993(OpenAlex)는 대규모 개방형 학술 데이터 인덱스를 제공하여 9069의 학술 검색 벤치마크 구축의 데이터 기반이 될 수 있다.
기반 연구학술 검색 벤치마크 설계의 기초 방법론을 제공함
기반 연구복잡한 학술 검색 의도 이해 능력을 평가하는 벤치마크로 PaSaMaster의 성능 검증에 활용될 수 있다.
다른 접근LLM 검색 능력 평가를 위한 다른 벤치마크 접근법을 제시함
다른 접근1016(Sci2Pol)은 과학-정책 변환에서 LLM을 평가하고 파인튜닝하는 연구로, 9069의 학술 검색 LLM 벤치마크와 LLM 학술 능력 평가라는 공통 주제를 공유한다.
다른 접근두 논문 모두 LLM의 학술적 능력을 평가하지만, 하나는 벤치마크 불일치 문제를 규명하고 다른 하나는 학술 검색 특화 벤치마크를 새로 구축한다.
다른 접근의료 연구 분야 AI 평가 벤치마크와 학술 검색 LLM 벤치마크는 서로 다른 도메인에서 AI 능력을 평가하는 유사한 접근법을 취한다.
후속 연구일반 검색 벤치마크를 학술 도메인으로 확장함
후속 연구LLM이 science of science를 강화하는 방식을 논한 이 연구는 학술 검색 능력 벤치마킹이 왜 중요한지를 맥락적으로 설명해준다.
후속 연구SciSciGPT가 과학적 발견을 위한 인간-AI 협력을 다루듯, ScholarSearch는 LLM의 학술 검색 능력 평가라는 구체적 벤치마크로 그 연장선에 있다.
후속 연구SciSciGPT의 문헌 검색 자동화 기능은 ScholarSearch 벤치마크가 평가하는 LLM 학술 검색 능력과 직접적으로 연결되어 상호 보완적 관계를 형성한다.
후속 연구1065(AI 과학자 서베이)는 AI가 과학 연구에 활용되는 현황을 조사하여 9069의 LLM 학술 검색 능력 벤치마크 연구에 더 넓은 맥락을 제공한다.
응용 사례AI4SoS 프레임워크에서 문헌 검색 자동화는 ScholarSearch가 측정하는 LLM 학술 검색 능력을 실제 science of science 연구에 적용하는 사례가 된다.
반론/비판ChatGPT 연구 평가의 문체적 편향을 분석한 논문은 LLM 학술 검색 능력 벤치마크의 한계와 편향 가능성을 보완적으로 이해하게 한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드