The Few-Shot Unreliability of Molecular Foundation Models: A Geometric Diagnosis and Partial Remedy

저자: Kevin Tirta Wijaya, Vahid Babaei | 날짜: 2026 | URL: https://openreview.net/forum?id=tUZqtcRXzu 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. MAE ratio relative to the Morgan FP regressor across training sizes (lower is better; 1.0 = parity with baseli

세 가지 분자 foundation model(Uni-Mol, MolFormer, ChemBERTa)의 frozen embedding이 아홉 개의 OpenADMET 회귀 endpoint에서 N=10부터 N=1000까지 모든 training size에서 Morgan fingerprint보다 지속적으로 열등함을 실증적으로 보이고, PLS projection을 진단 도구 겸 부분적 해결책으로 제시한다.

Motivation

Achievement

Figure 1

Figure 1. MAE ratio relative to the Morgan FP regressor across training sizes (lower is better; 1.0 = parity with baseli

  1. MFM의 일관된 열세 확인: 세 MFM 모두 N=10에서 N=1000까지 모든 training size에서 Morgan FP 대비 MAE ratio가 1.0을 초과하며, N=10에서 17-18%, N=1000에서 25-31%로 격차가 오히려 커지는 것을 발견했다.
  2. Endpoint-agnostic한 열등성 검증: rank 기반 분석(Figure 2)을 통해 이 열등성이 특정 endpoint에 국한되지 않고 아홉 개 endpoint 전반에서 일관되게 나타남을 확인했다.
  3. PLS를 통한 기하학적 진단: PLS projection(k=10)이 N=10에서 MolFormer 등의 성능 격차 대부분을 회복시켜, embedding 내에 ADMET 관련 정보가 존재하지만 소수 샘플만으로는 회귀모델이 발견할 수 없는 방향에 숨겨져 있음을 보였다.
  4. 근본적 한계 확인: PLS 적용 후에도 N≥100이 되기 전까지는 어떤 표현도 naive train-mean predictor 대비 R² 우위를 보이지 못함을 확인하여, foundation model이 가장 필요한 저데이터 영역에서 실질적으로 신뢰할 수 없음을 정량적으로 입증했다.

How

Figure 3

Figure 3. (a) Mean R2 scores across all datasets at various training set size. (b) At N = 10, no representation clearly

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: MFM이 few-shot 분자 property prediction에 만능 해결책이라는 통념에 실증적 반증을 제시하고 PLS를 통한 진단적 통찰을 더한 견고하고 시의적절한 연구이나, 제안된 해결책이 부분적이라는 한계 역시 스스로 명확히 인정하고 있다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.91로 Statistical Causal Inference Methods와 Scientific AI for Physics and Environment가 맞닿아, 'Scientific Machine Learning through Physics-Informed Neural Networks: Where we are and What's next'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구임베딩 공간의 기하학적 특성을 분석하는 이론적 기반을 제공한다.
다른 접근foundation model의 신뢰성과 embedding 품질을 다른 도메인에서 검증한다.
기반 연구SPECTER2 유사도 0.91로 Statistical Causal Inference Methods와 Molecular Simulation and Generative Modeling가 맞닿아, 'Equivariant Evidential Deep Learning for Interatomic Potentials'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근심리 측정 관련 LLM 평가의 유사한 벤치마크 연구
다른 접근ECG 표현학습을 위한 유사한 멀티모달 정렬 접근법을 제시하는 것으로 보인다.
다른 접근foundation model 임베딩 평가에 다른 벤치마크 방식을 사용함
다른 접근privileged information을 활용한 학습을 다른 프레임워크로 구현하는 대안적 접근이다.
다른 접근frozen embedding 대신 다른 표현 학습 방식을 제안하는 대안적 접근이다.
후속 연구GFlowNet의 sequential 생성 기법에 대한 방법론적 기반을 제공한다.
후속 연구persistent homology의 위상학적 특징 추출 기초를 제공하는 연구
후속 연구pseudo-label 기반 검증의 기초 개념을 제공한다.
후속 연구few-shot 상황에서의 foundation model 신뢰성 문제를 후속으로 다룸
후속 연구two-sample test statistic 기반 클래스 분리도 평가의 기초를 제공
반론/비판분자 foundation model의 신뢰성에 대해 상반된 결과를 제시하는 비교 연구이다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드