저자: | 날짜: 2026-05-08 | URL: https://www.biorxiv.org/content/10.64898/2026.05.06.721805v1 📄 PDF
Figure 1. Predicted structural landscapes of (A) GRAMPA and (B) non-GRAMPA.
본 연구는 머신러닝 기반 펩타이드 설계의 신뢰성 문제를 체계적으로 분석한다. 항균 활성 예측 모델 16종을 감사하여 학습 데이터의 불균형한 fold 표현과 data leakage가 구조적 편향을 유발하며, 이것이 모델 예측 성능을 심각하게 왜곡함을 정량화한다.
Figure 1. Predicted structural landscapes of (A) GRAMPA and (B) non-GRAMPA.
Figure 4. Structural diversity of GRAMPA and non-GRAMPA external validation
총평: 본 연구는 머신러닝 기반 펩타이드 설계의 신뢰성을 위협하는 structural bias를 체계적으로 규명한 중요한 감사 연구다. 16개 모델의 광범위한 벤치마킹과 엄격한 외부 검증을 통해 학습 데이터의 fold 불균형이 모든 아키텍처의 예측 성능을 일관되게 왜곡함을 정량적으로 입증했다. 다만 구체적인 완화 전략의 부재와 AMP 중심의 케이스 스터디로 인해 영향력은 제한적이나, 단백질 머신러닝 분야의 책임 있는 개발을 위한 표준 감사 관행을 제시한 점에서 학술적·실무적 가치가 크다.