TerraBind: Fast and Accurate Binding Affinity Prediction through Coarse Structural Representations
저자: Matteo Rossi, Ryan Pederson, Miles Wang-Henderson, Ben Kaufman, Edward C. Williams, Carl Underkoffler, Owen Lewis Howell, Adrian Layer, Stephan Thaler, Narbe Mardirossian, John Anthony Parkhill | 날짜: 2026 | URL: https://openreview.net/forum?id=xlevHY3oJO📄 PDF
⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.
라이선스: OpenReview 공개(오픈액세스)
Essence
TerraBind은 all-atom diffusion 없이 단백질 Cβ 원자와 리간드 heavy atom만을 사용하는 coarse pocket-level 표현으로 protein-ligand 구조 및 결합 친화도를 예측하는 foundation model로, Boltz-2 대비 26배 빠른 추론 속도와 최대 20% 향상된 affinity 예측 정확도를 달성한다.
Motivation
Known: AlphaFold2, RoseTTAFold, AlphaFold3, NeuralPLexer3, Boltz(2) 등 co-folding 모델들은 protein과 ligand를 함께 폴딩하여 물리 기반 도킹보다 높은 구조적 정확도와 결합 친화도 예측 성능을 보여왔다. 그러나 이러한 모델들은 iterative diffusion 과정에 의존해 복합체당 약 20초의 추론 시간이 소요되어 대규모 화합물 스크리닝에 부적합하다.
Gap: 기존 방법들은 속도-정확도 trade-off에 갇혀 있으며(Boltzina 같은 rigid-pocket 가정 도입 또는 sequence-based 모델의 data-poor target 취약성), 무엇보다 binding affinity에 대한 엄밀한 불확실성 정량화가 부재하다. ipTM, pLDDT 같은 구조적 신뢰도 점수는 기하학적 타당성만 평가할 뿐 affinity 신뢰도를 반영하지 못하며, 배치 단위(joint) 불확실성 정량화도 현재 아키텍처에 결여되어 있다.
Why: 고처리량 가상 스크리닝과 hit optimization을 실용적으로 만들기 위해서는 all-atom diffusion 기반의 계산 병목을 해소하면서도 정확도와 신뢰성 있는 불확실성 추정을 동시에 확보하는 모델이 필요하며, 이는 실제 신약 개발(DMTA) 사이클의 효율을 근본적으로 개선할 수 있다.
Approach: 전체 원자 diffusion이 정확한 pose 및 affinity 예측에 필수적이지 않다는 가설 하에, 사전학습된 분자/단백질 인코더와 경량 Pairformer trunk를 결합한 diffusion-free 구조 모듈과, 이로부터 얻은 pocket-level 표현을 사용하는 affinity likelihood 예측 모듈 및 epistemic uncertainty 모듈을 제안한다.
Achievement
diffusion-free 구조 예측 모듈: COATI-3(리간드)와 ESM-2(단백질) 고정 인코더에 48-layer 경량 Pairformer를 결합하여 Boltz-2 대비 26배 빠른 추론을 달성하면서 FoldBench, PoseBusters, Runs N' Poses에서 pose 정확도를 대등하게 유지.
본질적 구조 불확실성 지표 HLP: 별도 confidence 모듈 없이 pairwise distance entropy만으로 pose 정확도와 상관관계를 갖는 불확실성 신호 제공.
affinity 예측 성능 향상: CASP16 공개 벤치마크에서 Boltz-2 대비 Pearson 상관계수 +16%, 18개 proprietary assay 중 15개에서 +20% 향상.
소량 crystal 데이터 fine-tuning: 3–6개 예시만으로 held-out 화합물에 대해 약 17% affinity 성능 향상.
epinet 기반 보정된 불확실성: 낮은 불확실성 점수가 높은 예측 성공률과 상관관계를 보임.
continual learning 및 hedged batch selection: 시뮬레이션된 신약 발굴 사이클에서 greedy 전략 대비 6배 더 큰 affinity 개선.
How
Frozen pretrained encoders: COATI-3(SMILES 텍스트 transformer, 2D 그래프 transformer, chirality-aware SE(3)-equivariant Allegro 기반 3D conformer 인코더로 구성된 multimodal 분자 인코더, 10억개 이상 화합물로 contrastive loss 사전학습)와 ESM-2(650M, MSA 불필요한 단백질 서열 언어모델)를 사용.
구조 모듈: AlphaFold3 유래 Pairformer trunk를 채택하되 single-sequence representation과 diffusion 모듈을 제거하고 고정 임베딩을 활용, 파라미터를 147M에서 27M(48-layer)로 축소. 64개 거리 bin에 대한 categorical cross-entropy로 학습하여 expected distance와 normalized pairwise entropy(HLP)를 도출, 이를 통해 15Å binding pocket 정의.
총평: diffusion 없이도 coarse pocket-level 표현만으로 SOTA급 pose 정확도와 더 나은 affinity 예측이 가능함을 보인 실용적이고 임팩트 있는 연구로, 특히 불확실성 정량화와 continual learning 결합은 실제 신약 개발 파이프라인에 유용한 기여이나 proprietary 데이터 의존과 이해상충 요소는 독립적 검증의 필요성을 남긴다.
기반 연구SPECTER2 유사도 0.93 기준으로 'TerraBind: Fast and Accurate Binding Affinity Prediction through Coarse Structural Representations'의 AI4S 방법론을 'Boltz-1 Democratizing Biomolecular Interaction Modeling'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
기반 연구SPECTER2 유사도 0.94 기준으로 'TerraBind: Fast and Accurate Binding Affinity Prediction through Coarse Structural Representations'의 AI4S 방법론을 'An equivariant pretrained transformer for unified 3D molecular representation learning'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
기반 연구SPECTER2 유사도 0.94로 Computational Molecular Design와 AI-Driven Drug and Materials Discovery가 맞닿아, 'MolX: A Geometric Foundation Model for Protein–Ligand Modelling'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.94로 Computational Molecular Design와 AI-Driven Drug and Materials Discovery가 맞닿아, 'AF2BIND: predicting small-molecule binding sites using the pair representation of AlphaFold2'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.