A Survey of Scientific Large Language Models: From Data Foundations to Agent Frontiers

저자: Ming Hu, Chenglong Ma, Wei Li, Wanghan Xu, Jiamin Wu, Jucheng Hu, Tianbin Li, Guohang Zhuang, Jiaqi Liu, Yingzhou Lu, Ying Chen, Chaoyang Zhang, Cheng Tan, Jie Ying, Guocheng Wu, Shujian Gao, Pengcheng Chen, Jiashi Lin, Haitao Wu, Lulu Chen | 날짜: 2025-08-28 | URL: https://arxiv.org/abs/2508.21148 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

Essence

Figure 1

Fig. 1: The song of humanity is a song of courage. The diagram depicts the continuum of scientific inquiry spanning from

본 논문은 과학 분야 대규모 언어 모델(Scientific Large Language Models, Sci-LLMs)의 발전을 데이터 중심으로 종합 분석하는 설문연구로, 270개 이상의 사전/후학습 데이터셋과 190개 이상의 벤치마크를 검토하여 과학 AI의 로드맵을 제시한다.

Motivation

Achievement

Figure 2

Fig. 2: Cumulative trend of publications on major preprint platforms whose titles or abstracts mention the keyword “lang

  1. 과학 데이터의 통합 분류체계: 텍스트, 시각, 기호, 구조화, 시계열, 멀티오믹스 등 6가지 주요 데이터 형식과 사실, 이론, 방법론, 모델링, 통찰의 5단계 지식 계층을 정의
  2. 대규모 데이터 분석: 270개+ 사전/후학습 데이터셋과 190개+ 벤치마크를 체계적으로 분석하여 과학 AI의 데이터 수요 특성 규명
  3. Sci-LLMs 진화 추적: 2018-2025년의 4단계 패러다임 전환(일반 LLM → 과학 특화 → 도메인 특화 → 자율 에이전트)을 파악
  4. 평가 패러다임 전환: 정적 시험에서 발견 지향적 평가로의 변화와 고급 평가 프로토콜 제시
  5. 자동화 파이프라인 제안: 준자동화 주석 및 전문가 검증 기반 데이터 개선 방안 제시

How

Originality

Limitation & Further Study

Evaluation

Novelty: 5/5 Technical Soundness: 4/5 Significance: 5/5 Clarity: 4/5 Overall: 4/5

총평: 본 설문연구는 과학 AI의 발전을 데이터 중심으로 종합적으로 분석하는 최초의 시도로, 혁신적인 분류체계와 광범위한 실증 분석을 통해 Sci-LLMs의 현황을 명확히 하고 자율 에이전트 기반 폐쇄 루프 시스템이라는 미래 방향을 제시한다. 과학 분야 AI의 로드맵으로서 높은 학술적 가치와 실용적 중요성을 가지고 있으나, 실제 구현 방안에 대한 상세한 기술과 각 도메인별 심화 분석은 후속 연구로 남겨져 있다.

같이 보면 좋은 논문

기반 연구scispaCy의 NER 도구를 생의학 응용에 적용한다.
기반 연구few-shot 기반 SPARQL 생성 방법을 확장한다.
다른 접근과학 텍스트를 위한 다른 도메인 특화 언어모델 접근법
다른 접근과학 분야 LLM 발전을 유사하게 종합 분석
다른 접근LLM 기반 과학적 발견 자동화의 다른 접근법을 제시한다.
다른 접근과학 LLM의 데이터셋과 벤치마크를 다루는 유사 서베이
후속 연구동일 주제인 과학 LLM 데이터 기반 조사를 확장한 버전으로 매우 높은 유사도를 보임
후속 연구과학적 창의성과 아이디어 재조합 분석을 위한 방법론적 토대 제공
후속 연구과학 분야 LLM의 데이터 기반과 에이전트 프론티어를 종합 분석한 이 서베이는 대상 논문이 평가하는 AI Scientist 시스템의 기술적 토대를 제공한다.
후속 연구SPECTER2 유사도 0.91로 Computational Molecular Design와 AI-Driven Drug and Materials Discovery가 맞닿아, 'A Survey of Scientific Large Language Models: From Data Foundations to Agent Frontiers'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드