How deep do large language models internalize scientific literature and citation practices? arXiv preprint arXiv:2504.02767, 2025.

저자: Andres Algaba, Vincent Holst, Floriano Tori, Melika Mobini, Brecht Verbeken, Sylvia Wenmackers, Vincent Ginis | 날짜: 2025 | DOI: N/A 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

Essence

Figure 1

그림 1: 논문의 제목, 저자, 연도, 학술지, 초록을 기반으로 LLM이 생성한 참고문헌과 인간의 인용 패턴을 비교하는 실험 개요

대규모 언어 모델(LLM)이 과학 논문의 참고문헌 생성 시 이미 인용도가 높은 논문들을 지속적으로 선호함으로써 인용의 마태 효과(Matthew effect)를 강화하며, 이는 학문 영역 간 편향의 차이에도 불구하고 일관되게 나타난다. 이러한 현상은 과학 지식의 발견과 확산 방식을 재형성할 가능성이 있다.

Motivation

Achievement

Figure 3

그림 3: 학문 영역과 시간에 따른 생성 참고문헌의 존재율(existence rate) 및 인용 특성 비교

  1. 마태 효과의 강화(Matthew effect reinforcement): LLM이 생성한 참고문헌 중 실제로 존재하는 참고문헌들(existence rate 42.6%)은 인간의 참고문헌 대비 현저히 높은 중앙값 인용도를 보임. 이는 이미 인용도 높은 논문이 더욱 많은 추가 인용을 받는 누적 우위 현상을 의미하며, 모든 학문 영역과 시간 기간에 걸쳐 일관되게 관찰됨.
  2. 학문 영역별 편차: 인문학과 사회과학에서는 40-50%의 높은 존재율을 보이는 반면, 정확한 과학(exact sciences)에서는 더 낮은 존재율을 나타냄. 이는 인문학과 사회과학이 더 오래된 참고문헌을 인용하는 경향과 관련됨.
  3. 체계적인 인용 편향: LLM은 더 최근의 참고문헌(더 짧은 제목, 더 많은 저자)을 선호하며, 이는 인간의 인용 패턴과 일부 차이를 보임. 의미론적 유사성(textual embedding) 분석 결과, 생성된 참고문헌의 의미적 적절성은 인간의 참고문헌과 비교할 수 있는 수준이나, 네트워크 특성에서는 저자 자기인용을 감소시킴.

How

Figure 4

그림 4: 생성된 참고문헌의 체계적 편향 - 발행연도, 저자 수, 제목 길이 선호도

Originality

Limitation & Further Study

Evaluation

Novelty: 4.5/5 Technical Soundness: 4/5 Significance: 4.5/5 Clarity: 4/5 Overall: 4.2/5

총평: 본 논문은 LLM이 과학 참고문헌 생성 시 체계적으로 마태 효과를 강화하며 인간의 인용 관행과 차이를 보인다는 중요한 발견을 대규모 실증 데이터로 제시하여, AI 도입이 과학적 지식 발견의 형태를 재편할 수 있음을 시사한다. 다만 순수 매개변수 지식 기반 평가라는 제한과 학문 영역 표본 편향을 고려할 때, 실제 운영 환경에서의 영향은 추가 검증이 필요하다.

같이 보면 좋은 논문

기반 연구MIRAI의 예측 프레임워크를 확장하거나 개선한 후속 연구로 보인다.
다른 접근인용 추천 및 생성에서의 편향 문제를 다른 방법으로 접근한다.
다른 접근학술 커뮤니케이션에서의 언어 다양성 문제를 다른 방법론으로 접근한 연구
다른 접근410이 LLM 인용 생성의 편향을 분석하는 반면, 1027은 컴퓨터 과학의 젠더 인용 불균형을 분석하여 학술 인용 편향의 AI적 원인과 사회적 원인을 비교 검토할 수 있다.
후속 연구1036의 과학 펀딩에서의 매튜 효과 연구는 410이 발견한 LLM 인용 생성에서의 매튜 효과와 연결되어, AI가 기존 학술 불평등 구조를 어떻게 강화하는지 이해하는 데 중요한 맥락을 제공한다.
후속 연구1008의 천문학 저널 인용 편향 연구는 410이 분석하는 LLM의 인용 편향 문제와 연결되어, 기존 학술 시스템과 AI 모두에서 나타나는 인용 불균형 패턴을 비교 분석할 수 있다.
후속 연구LLM의 인용 편향과 마태 효과를 다루는 핵심 관련 연구이다.
응용 사례LLM 기반 인용 생성의 실제 적용 사례로 편향 현상을 뒷받침한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드