저자: | 날짜: 2026-04-19 | URL: https://www.biorxiv.org/content/10.64898/2026.04.18.719394v1 📄 PDF
Figure 2: Composition of BELKA dataset and baseline ML performance BELKA dataset. A) Distribution of In Distribution (sh
DNA 인코딩 라이브러리(DEL) 데이터로 학습된 기계학습 모델의 일반화 능력을 체계적으로 평가하는 논문. NeurIPS 2024 BELKA 경진대회 데이터를 활용하여 ML, docking, co-folding 방법을 비교하고, out-of-distribution 화합물 예측의 어려움을 입증하며 물리 기반 방법과의 보완 관계를 분석.
Figure 4. Performance of structure-based methods on the OOD BELKA set and analysis of and training on physics-derived fe
Figure 3: Performance of baseline ML model with modified train and test sets. A) Mean average precision of baseline mode
총평: 이 논문은 대규모 공개 데이터(BELKA)를 활용하여 DEL 기반 ML 모델의 OOD 일반화 문제를 처음으로 체계적으로 규명한 중요한 연구이다. 단순한 벤치마킹을 넘어 여러 물리 기반 방법과의 비교를 통해 현실적인 통찰력을 제시하며, 실용적인 오픈소스 도구(DEL-iver)를 제공한다. 다만 OOD 실패 메커니즘에 대한 이론적 분석 심화와 외부 데이터셋 검증이 있으면 더욱 강력한 논문이 될 것이다.