⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.
Essence
Figure 1: Keyword trajectories reflect critical paradigm shifts in AI and epidemiology research over
본 논문은 arXiv에서 수집한 200만 개 이상의 학술 논문과 인용 그래프를 포함하는 30년 규모의 종단 scientometrics 데이터셋 Scito2M을 소개한다. 이를 통해 학술 용어 진화, 인용 패턴, 학제 간 지식 교류의 시간적 변화를 분석하여 과학적 지식의 창출 및 확산 방식을 이해한다.
Motivation
Known: Scientific knowledge의 진화와 확산을 이해하는 것이 과학 발전과 글로벌 과제 해결에 중요함은 잘 알려져 있다. 기존 scientometrics 연구들은 논문 콘텐츠와 인용 네트워크 분석을 통해 연구 동향과 영향력을 파악해 왔으나, 대규모 종단 데이터셋의 부재와 분석 범위의 제한이라는 과제가 존재한다.
Gap: 기존 scientometrics 데이터셋들은 콘텐츠 수준과 인용 수준 정보를 동시에 포함하면서 다학제적이고 장기간에 걸친 종합적 분석을 지원하는 대규모 데이터셋이 부족하며, 대부분의 연구가 제한된 시간 범위, 특정 분야만을 대상으로 한다는 한계가 있다.
Why: 종단적 scientometrics 분석을 통해 과학적 지식의 진화 과정을 체계적으로 추적할 수 있으며, 이는 학제 간 연구가 글로벌 도전과제 해결에 어떻게 기여하는지 이해하는 데 필수적이다. 또한 서로 다른 분야의 인용 문화와 지식 생산 방식의 차이를 드러내는 데 도움이 된다.
Approach: arXiv에서 1991년부터 2024년까지 200만 개 이상의 논문을 수집하고, Semantic Scholar API를 통해 인용 관계를 획득하며, GPT-4o를 사용하여 제목과 초록에서 키워드를 추출한다. 시간별 스냅샷으로 분할하여 거시적 키워드 순위 변화와 미시적 용어 사용 패턴을 분석하며, Simpson's Diversity Index 등을 활용하여 인용 네트워크의 다양성을 측정한다.
Achievement
Figure 2: Evolution in the ranks of math and machine-learning terms among all keywords over time.
데이터셋 구축: 34년 범위의 156개 카테고리에 속하는 210만 개 논문, 상세한 메타데이터 및 인용 그래프를 포함하는 종합 scientometrics 데이터셋 Scito2M 제공. 패러다임 시프트 발견: Machine learning 관련 용어가 2010년 이전 연평균 0.31개에서 2015년 이후 9.5개로 급증. 인용 패턴 분석: 학제 간 인용이 전체의 9% 미만인 반면 학과 내 인용이 91% 이상으로 강한 동형성(homophily) 확인. 분야별 인용 차이: LLM 연구의 인용 나이 중앙값 2.48년 대 구술사 9.71년으로 응용 분야의 citation amnesia 현상 입증. 분석 도구 제공: 시각화 및 분석 도구를 GitHub, Kaggle, HuggingFace에서 제공.
How
Figure 2: Evolution in the ranks of math and machine-learning terms among all keywords over time.
arXiv API를 통해 Creative Commons 라이선스 논문 2.1백만 개 수집 및 8개 주제별 카테고리화
Semantic Scholar API로부터 각 논문의 인용 관계, 발표 장소, 저자 정보 획득
GPT-4o를 활용한 제목 및 초록 키워드 자동 추출
시간 기반 스냅샷 구성하여 키워드 빈도 순위 변화 추적
Keyword co-occurrence graph와 Graph Neural Network을 이용한 시간적 임베딩 학습
Simpson's Diversity Index, Shannon Diversity, Gini Coefficient를 통한 인용 다양성 측정
학제 간 vs 학제 내 인용 비율 및 인용 나이(Age of Citation) 분석
Originality
학술 출판의 진화를 추적하기 위해 GPT-4o 기반 키워드 추출과 시간적 임베딩을 결합한 새로운 분석 방법론 제시
30년간의 대규모 종단 데이터를 바탕으로 패러다임 시프트, 용어 진화, 학제별 인용 문화 차이를 체계적으로 분석하는 cross-disciplinary scientometrics 관점 제공
arXiv의 전체 히스토리를 포괄하는 최대 규모 scientometrics 데이터셋 구축
Limitation & Further Study
데이터 소스 제한: arXiv 논문만을 대상으로 하므로 전통 학문(인문학, 사회과학의 일부)의 대표성이 제한됨. 인용 정보 의존성: Semantic Scholar에 의존하므로 누락되거나 잘못된 인용 매핑의 위험. 키워드 추출 오류: GPT-4o의 키워드 추출 정확도 검증 부재. 향후 연구에서는 (1) 다른 출판 플랫폼(PubMed, IEEE Xplore 등) 통합, (2) 인용 매핑 정확도 평가, (3) 키워드 추출 검증 체계 구축이 필요.
총평: 본 논문은 과학적 지식의 진화를 종단적으로 분석하기 위한 포괄적이고 접근성 높은 대규모 데이터셋과 분석 도구를 제공함으로써 scientometrics 연구에 상당한 기여를 한다. 30년에 걸친 자료를 통해 패러다임 시프트, 용어 진화, 분야별 인용 문화 차이 등 새로운 통찰을 제시하며, GitHub 등을 통한 공개로 재현성과 활용성이 높다. 다만 arXiv 데이터만 활용했다는 범위 제한과 키워드 추출 정확도 검증 부재가 보완되어야 한다.