저자: | 날짜: 2026-04-15 | URL: https://arxiv.org/abs/2604.15380 📄 PDF
Fig. 1. Multi-task learning training for MLIPs on multi-source, multi-fidelity data, with shared message-passing represe
본 논문은 16개 제일원리 데이터셋(5억 4400만 구조)을 활용한 다중 과제 학습 기반 PaiNN 그래프 파운데이션 모델을 Frontier·Aurora·Perlmutter 슈퍼컴에서 학습하여, 11억 구조를 50초에 스크리닝할 수 있는 지수급 가속을 달성하였다.
Fig. 5. Fused Gradient Inference Pipeline. The encoder executes once and its
제1원리 데이터셋 규모: 16개 데이터셋 5억 4400만 구조로 기존 연구 초과. 지수급 추론 성능: 1.1억 구조를 50초 내 평가(수년치 DFT 계산 압축). 다중 충실도 균형: 불균형 코퍼스에서 교차 도메인 견고성 유지. 정밀도 분석: BF16/FP32/FP64 트레이드오프 및 강제 미분 수치 오차 영향 정량화. 전이 학습: 12개 다운스트림 과제에서 데이터 부족 미세조정 성능 입증. 이기종 확장성: Frontier·Aurora·Perlmutter 간 강한·약한 스케일링 효율 입증.
Fig. 5. Fused Gradient Inference Pipeline. The encoder executes once and its
총평: 본 논문은 불균형 다중 충실도 원자 데이터에서 처음 지수급 다중 과제 파운데이션 모델을 구축하고, 이기종 슈퍼컴 간 이식성과 정밀도 특성화를 입증하여 과학 머신러닝의 실무적 배포 장벽을 크게 낮추었다. 544M 구조 학습과 11억 구조 50초 스크리닝은 소재 발견의 패러다임을 바꾸며, 정밀도 트레이드오프·강제 미분 오차 분석은 배포 제약 하 과학 ML의 신뢰성을 강화한다. 다만 다운스트림 과제별 세밀한 오류 분석과 헤드 설계 원리 정밀화가 필요하다.