ProMiSE: Protein Multi-State Evaluation Benchmark in Biological Contexts

저자: Bonjae Ku, Seeun Kim, Yubeen Kim, Hahnbeom Park, Chaok Seok | 날짜: 2026 | URL: https://openreview.net/forum?id=5ZN3tiSetW 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. Overview of the ProMiSE dataset curation pipeline. Sequence clusters at 95% identity were retrieved from RCSB,

ProMiSE는 단백질의 intrinsic, ligand-induced, protein-induced 세 가지 conformational change 메커니즘을 통합한 최초의 multi-state 구조 예측 벤치마크로, native biological assembly 기반 curated dataset과 평가 스킴을 함께 제공한다. 이를 통해 AlphaFold3를 포함한 최신 구조 예측 모델들이 여러 conformational state를 얼마나 잘 샘플링하는지 정량적으로 평가한다.

Motivation

Achievement

Figure 2

Figure 2. Conformational sampling performance across models. (A) Cluster-level success rates across three dataset catego

  1. ProMiSE 벤치마크 구축: RCSB PDB에서 1,333,459개 초기 pair를 필터링하여 234개 sequence cluster, 786개 entry, 577개 pair로 구성된 curated multi-state dataset을 완성하고, intrinsic/ligand-induced/protein-induced 세 메커니즘에 대한 명시적 성공 기준과 정량적 conformational bias 지표를 정의함.
  2. 체계적인 conformational collapse 발견: AlphaFold3를 포함한 최신 생성형 모델들이 intrinsic multi-state 샘플링에서 약 20% cluster-level success에 그치며 단일 dominant state로 수렴하는 경향을 보이고, induced scenario에서는 apo-conditioned input에도 불구하고 holo-like conformation으로 예측이 편향됨을 확인함.
  3. 실패 원인의 파이프라인 추적: training data, MSA, pair representation, 최종 output structure를 단계별로 분석하여, distogram 단계에서는 뚜렷한 state 선호가 없음에도 structure module 단계에서 training set memorization으로 인해 dominant conformation으로 collapse가 발생함을 규명함.
  4. BioEmu를 통한 개선 가능성 제시: decoding 단계의 bias를 줄이는 것이 upstream pair representation의 큰 변화 없이도 multi-state sampling을 실질적으로 향상시킬 수 있음을 BioEmu 결과를 통해 보임.

How

Figure 3

Figure 3. Distogram-level versus structure-level state preference across models. (A) Scatter plots of DynDistoholo (x-ax

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 5/5 Clarity: 4/5 Overall: 4/5

총평: ProMiSE는 단백질 구조 예측 모델의 dynamics-aware 능력을 체계적으로 검증할 수 있는 최초의 통합 벤치마크로서 시의적절하고 중요한 기여이며, 향후 차세대 모델 개발과 평가의 표준 도구로 자리잡을 잠재력이 크다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.94로 Computational Molecular Design와 AI-Driven Drug and Materials Discovery가 맞닿아, 'Boltz-1 Democratizing Biomolecular Interaction Modeling'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구생물학적 시퀀스 표현 학습을 실제 변이 효과 예측에 적용한 사례이다.
기반 연구구조 예측 신호를 실제 벤치마크 평가에 적용한 사례이다.
기반 연구ProSAM의 성능을 ProMiSE 벤치마크로 검증할 수 있는 응용 관계임.
응용 사례ProSAM과 같은 protein language model이 ProMiSE 벤치마크로 평가될 수 있는 관계임.
기반 연구conformational ensemble 기반 평가 방법을 확장한 연구.
기반 연구단백질 구조 예측 모델의 기초 아키텍처를 제공함.
기반 연구Progressive Consistency Regularization과 유사한 가속화 샘플링 기법을 확장한다.
기반 연구structure-based representation의 정보 이득을 확장하여 다른 downstream task에 적용함
기반 연구SPECTER2 유사도 0.93 기준으로 'ProMiSE: Protein Multi-State Evaluation Benchmark in Biological Contexts'의 AI4S 방법론을 'Atomic Trajectory Modeling with State Space Models for Biomolecular Dynamics'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
기반 연구SPECTER2 유사도 0.94로 Computational Molecular Design와 Molecular Simulation and Generative Modeling가 맞닿아, 'Learning the All-Atom Equilibrium Distribution of Biomolecular Interactions at Scale'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.94로 Computational Molecular Design와 LLMs for Molecular Biology & Chemistry가 맞닿아, 'Orthrus: toward evolutionary and functional RNA foundation models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근RNA 기반모델 구축을 위한 다른 아키텍처적 접근을 제시한다.
다른 접근단백질 돌연변이 신호를 다루는 다른 데이터셋 구축 및 평가 방법을 제시함
다른 접근단백질-리간드 결합 예측을 위한 다른 생성 모델 접근이다.
다른 접근대체 conformation 예측을 위한 MSA 조작이라는 유사 문제를 다른 기준으로 해결한다.
다른 접근SE(3)-invariant 구조 기반 스코어링을 활용하는 binder 설계 관련 연구로 판단된다.
후속 연구단백질 구조 예측 벤치마크를 multi-state로 확장한 밀접한 후속 연구이다.
다른 접근protein language model의 일반화 vs 암기 문제를 벤치마킹한다는 동일한 접근이다.
후속 연구conformational state 예측을 다루는 단백질 구조 모델을 확장한 연구임.
다른 접근단백질 conformational change 평가를 위한 다른 벤치마크 접근을 제시한다.
후속 연구구조 예측 모델(RosettaFold3 등)을 활용한 단백질 설계의 기반 기술을 공유한다.
후속 연구multi-target 조건화 설계라는 방법론적 기반을 공유
후속 연구biomolecular 구조 생성 모델의 기초가 되는 방법론을 제공한다.
후속 연구단백질 구조 생성 모델의 기초 방법론을 공유한다.
후속 연구단백질 서열 및 구조 표현 학습이라는 공통된 방법론적 기반을 공유한다.
후속 연구단백질 표현 학습이라는 공통된 방법론적 기반을 공유한다.
후속 연구단백질 등 biomolecule의 generative modeling을 위한 핵심 구조 표현 기법을 공유한다.
후속 연구단백질 구조 기반 생성모델링의 핵심 표현 기법을 공유한다.
후속 연구구조 기반 안정성 예측 모델을 pLM에 통합하는 이론적 토대가 되는 연구로 보인다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드