Scaling Laws of Global Weather Models

저자: Yuejiang Yu, Langwen Huang, Alexandru Calotoiu, Torsten Hoefler | 날짜: 2026 | URL: https://openreview.net/forum?id=exS97jumOg 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. Scaling behavior of global weather models. We report

본 논문은 데이터 기반 전지구 기상예측 모델(GraphCast, AIFS, Aurora, Pangu, SFNO)에 대해 model size(N), dataset size(D), compute budget(C)에 따른 scaling law를 최초로 교차 모델 분석하며, weather forecasting model이 언어모델과 달리 depth보다 width를 선호하는 근본적으로 다른 scaling 양상을 보인다는 것을 규명한다.

Motivation

Achievement

Figure 2

Figure 2. Data-scaling laws across weather forecasting models:

  1. Cross-model scaling 분석 최초 제시: GraphCast, AIFS, Aurora, Pangu, SFNO에 대해 forecast skill과 N, D 관계를 규명하는 최초의 교차 모델 분석을 수행했다.
  2. Aurora의 뛰어난 data-scaling 효율: 학습 데이터를 10배 늘리면 validation loss가 최대 3.2배 감소하는 가장 강한 data-scaling 거동을 보였다(β=0.51).
  3. GraphCast의 뛰어난 parameter 효율성: GraphCast는 최소 파라미터(36.7M)로도 가장 높은 parameter efficiency를 보였으나, hardware utilization이 제한적이라는 trade-off를 확인했다.
  4. Compute-optimal 자원 배분 지침: 고정된 compute budget 하에서는 모델 크기 확장보다 총 학습 데이터 증가가 더 큰 성능 향상을 가져온다는 것을 실증했다.
  5. Width 선호의 근본적 차이 발견: LLM에서 관측된 것과 달리 weather forecasting 모델은 depth보다 width 확장을 일관되게 선호한다는 새로운 scaling 양상을 밝혔다.
  6. 변수별 scaling 이질성 규명: 전체 validation loss만으로는 모델 성능을 정확히 대변할 수 없으며, 변수(온도, 습도 등)별로 scaling 거동이 상이함을 확인했다.

How

Figure 3

Figure 3. Parameter-scaling laws for different weather prediction

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 기상 예측 분야에서 scaling law를 체계적으로 규명한 최초의 실증 연구로서, LLM과 다른 width 선호 경향 등 실용적으로 중요한 통찰을 제공하는 의미 있는 기여를 담고 있다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'GPT-4 Technical Report'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.91 기준으로 'Scaling Laws of Global Weather Models'의 AI4S 방법론을 'OLMo: Accelerating the Science of Language Models'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
기반 연구SPECTER2 유사도 0.91로 LLM Reasoning and Safety Benchmarks와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Mind the gap: Examining the self-improvement capabilities of large language models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구데이터 기반 전지구 기상모델의 이론적 토대를 제공하는 선행 연구이다.
기반 연구compute budget 기반 스케일링 분석의 방법론적 기반을 제공함
다른 접근데이터 기반 예측 모델의 스케일링 법칙을 다른 도메인에서 분석함
다른 접근기상예측 모델 성능과 규모 간의 관계를 유사하게 다룸
다른 접근전지구 기상 모델 비교라는 유사한 문제를 다룸
다른 접근생체신호 데이터를 위한 다른 형태의 foundation model을 제안한다.
다른 접근증상 검색 데이터를 이용한 대안적 예측 방법론을 제시함
다른 접근기상예측 모델의 스케일링 법칙을 다루는 유사 주제의 대안적 접근이다.
후속 연구대규모 모델 학습을 위한 병렬화 기법의 기초적 논의를 공유한다.
후속 연구기존 기상예측 모델을 스케일링 관점에서 확장한 연구로 관련성이 높다.
반론/비판기존 벤치마크의 데이터 누수 및 shortcut learning 문제를 지적하는 비판적 관점을 공유한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드