저자: | 날짜: 2026-04-14 | URL: https://www.biorxiv.org/content/10.64898/2026.04.10.717657v1 📄 PDF
Figure 4: Spectral Density KDE Estimation for Human Serum Albumin
본 논문은 Protein Contact Networks (PCNs)에 그래프 기계학습을 적용하여 인간 프로테옴 규모에서 효소 활성과 EC 클래스 할당을 예측한다. Spectral density embeddings, algebraic topology 기반 표현, graph kernels, Graph Neural Networks (GNNs)를 포함한 다양한 GML 기법을 체계적으로 비교한다.
Figure 2: Number of features at various threshold levels for Task A.
Task A (이진 분류): Jaccard-based graph kernel이 adjusted balanced accuracy 0.90으로 최우수 성능, GNNs가 근접. Task B (다중 분류): GNNs이 adjusted balanced accuracy 0.92로 모든 explicit embedding 및 kernel-based 방법을 능가. EC 클래스 예측이 이진 효소 판별보다 내재적으로 복잡하며 deep message-passing architectures의 높은 표현성에서 이점을 얻는 것을 입증.
Figure 5: Sample GNN structure
총평: 본 논문은 단백질 기능 예측을 위한 그래프 기계학습의 포괄적이고 체계적인 벤치마킹을 제공한다. Spectral, algebraic topology, kernel, 그리고 deep learning 기반 방법들을 대규모 proteome 수준에서 비교하여 각 접근법의 상대적 강점을 명확히 한다. 실험 설계의 엄밀함(반복 stratified splits, class imbalance-aware metrics, 동일한 평가 프로토콜)과 규모의 광범위함이 강점이나, 계층적 EC 분류 활용, 고급 node/edge features 통합, 교차 종 일반화 등에서 개선의 여지가 있다.