Don't Stop Pretraining: Adapt Language Models to Domains and Tasks

저자: Suchin Gururangan, Ana Marasović, Swabha Swayamdipta, Kyle Lo, Iz Beltagy | 날짜: 2020 | DOI: 10.18653/v1/2020.acl-main.740 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

Essence

광범위한 데이터로 사전학습(pretraining)된 대규모 언어 모델(RoBERTa)을 도메인별·작업별로 추가 적응(adaptation)하면, 다양한 자원 환경에서 지속적인 성능 향상을 달성할 수 있음을 보여준다.

Motivation

Achievement

Figure 2: 도메인 간 어휘 중복도(%) 분석 - RoBERTa 사전학습 도메인(PT)과 각 도메인 간의 유사성 정량화

어휘 중복도를 통한 도메인 유사성 분석: CS와 생의학(BioMed) 도메인이 PT 도메인과 가장 멀리 떨어져 있음

  1. 도메인 적응 사전학습(DAPT)의 일관된 효과: 생의학, CS, 리뷰 도메인에서 RoBERTa 대비 지속적 성능 향상 달성(예: ACL-ARC 63.0% → 75.4%, CHEMPROT 81.9% → 84.2%). 고자원/저자원 설정 모두에서 개선 확인
  2. 도메인 적응과 작업 적응의 상승 효과: DAPT 후 TAPT를 추가로 적용하면 더 큰 성능 향상 달성, 즉 다단계 적응 사전학습(multi-phase adaptive pretraining)이 효과적임을 입증
  3. 도메인 관련성의 중요성: 무관한 도메인으로 적응한 경우(¬DAPT) RoBERTa보다 성능이 악화되어, 단순 데이터 노출 증가가 아닌 도메인 관련성이 핵심 요인임을 증명
  4. 자동 데이터 선택 전략: 인간 큐레이션 데이터 부재 시 간단한 데이터 선택 전략으로 작업 적응 사전학습 성능을 향상시킬 수 있는 실용적 대안 제시

How

Figure 1: 데이터 분포의 계층 구조 - 관찰 가능한 작업 분포(task distribution)와 더 넓은 도메인 분포(domain distribution)의 관계 도시

작업 데이터는 도메인 분포의 부분집합이며, 원본 사전학습 도메인과 반드시 겹치지 않음을 시각화

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 5/5 Clarity: 5/5 Overall: 4.5/5

총평: 본 논문은 현대 NLP의 통념(대규모 광범위 모델로 충분함)에 대한 실증적 반박을 제공하는 중요한 연구로, 4개 도메인의 8개 작업에 걸친 체계적 비교를 통해 도메인/작업 적응 사전학습의 일관된 효과를 입증했다. 어휘 겹침 분석으로 적응 이득을 사전에 예측 가능하게 하고, 자동 데이터 선택 전략으로 실무적 적용성을 높였다는 점에서 ACL 2020의 주요 기여 논문으로 평가받을 만하다.

같이 보면 좋은 논문

기반 연구도메인 적응 사전학습의 이론적 기초를 제공하는 연구로 추정된다.
후속 연구SPECTER2 유사도 0.93로 Computational Molecular Design와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Don't Stop Pretraining: Adapt Language Models to Domains and Tasks'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근사전학습 모델의 도메인 적응 방법론에 대한 대안적 접근
다른 접근AutoML 도구 평가에 대한 다른 벤치마킹 접근을 제시한다.
다른 접근도메인별 언어모델 적응에 대한 대안적 접근법을 제시하는 연구이다.
다른 접근단일세포 데이터 전이학습을 위한 대안적 도메인 적응 방법을 제시한다.
후속 연구다양한 자원 환경에서의 언어모델 적응 전략을 확장한 연구
후속 연구도메인 적응을 위한 언어모델 지속 사전훈련 방법이 OLMo의 과학적 연구 활용 방향과 직접 연관된다.
후속 연구SPECTER2 유사도 0.92로 Multimodal Biomedical Data Fusion와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Don't Stop Pretraining: Adapt Language Models to Domains and Tasks'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.91 기준으로 'Mutual Information-Guided Corruption for Improved Self-Supervised Representation Learning in Tabular Data'의 AI4S 방법론을 'Don't Stop Pretraining: Adapt Language Models to Domains and Tasks'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
후속 연구SPECTER2 유사도 0.90로 Multimodal Biomedical Data Fusion와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Don't Stop Pretraining: Adapt Language Models to Domains and Tasks'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.89 기준으로 'OSF: On Pre-training and Scaling of Sleep Foundation Models'의 AI4S 방법론을 'Don't Stop Pretraining: Adapt Language Models to Domains and Tasks'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
후속 연구언어모델의 도메인 적응 기법을 확장하는 후속 연구로 보인다.
후속 연구SPECTER2 유사도 0.92로 Clinical Time-Series Modeling와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Don't Stop Pretraining: Adapt Language Models to Domains and Tasks'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.91로 Statistical Causal Inference Methods와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Don't Stop Pretraining: Adapt Language Models to Domains and Tasks'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.91로 Multimodal Biomedical Data Fusion와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Don't Stop Pretraining: Adapt Language Models to Domains and Tasks'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.90로 Scientific Machine Learning for Dynamics와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Don't Stop Pretraining: Adapt Language Models to Domains and Tasks'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.88로 Multimodal Biomedical Data Fusion와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Don't Stop Pretraining: Adapt Language Models to Domains and Tasks'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.92로 Computational Molecular Design와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Don't Stop Pretraining: Adapt Language Models to Domains and Tasks'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.91로 Clinical Time-Series Modeling와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Don't Stop Pretraining: Adapt Language Models to Domains and Tasks'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.92로 Statistical Causal Inference Methods와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Don't Stop Pretraining: Adapt Language Models to Domains and Tasks'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.89로 Multimodal Biomedical Data Fusion와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Don't Stop Pretraining: Adapt Language Models to Domains and Tasks'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구SPECTER2 유사도 0.91로 Clinical Time-Series Modeling와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Don't Stop Pretraining: Adapt Language Models to Domains and Tasks'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드