Learning Protein Fitness Landscapes with Multimodal Stability Priors

저자: Shannon SQ Zhang, Yunan Luo | 날짜: 2026 | URL: https://openreview.net/forum?id=8sCCiit00K 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

PsiFit는 sparse한 fitness 라벨(low-N)만으로도 단백질 변이 효과를 정확히 예측하기 위해, 다중모달(sequence-structure) 안정성 예측 모델 SPURS의 ∆∆G 정보를 protein language model(pLM)의 logit에 주입하고 contrastive fine-tuning으로 학습하는 프레임워크이다.

Motivation

Achievement

Figure 2
  1. ProteinGym 벤치마크에서 최고 성능 달성: 114개의 non-stability DMS 데이터셋에서 PsiFit이 mean Spearman 0.509, median 0.527로 ESM-1v(0.433/0.461) 및 Augmented DeepSequence(0.479/0.490)를 능가함.
  2. 통계적으로 유의미한 개선: paired Wilcoxon signed-rank test에서 ESM-1v 대비 p<0.001, Augmented DeepSequence 대비 p=2.32×10^-5로 유의한 성능 향상을 확인함.
  3. 데이터셋 단위 우위 확인: 114개 중 84개(ESM-1v 대비), 79개(Augmented DeepSequence 대비) 데이터셋에서 우세했으며, 65개 데이터셋에서 세 방법 중 최고 성능을 기록함.
  4. stability 정보의 일반화 검증: stability 측정 DMS를 제외한 데이터셋에서도 성능 향상을 보여 stability prior가 단순히 stability 자체를 예측하는 것을 넘어 다양한 fitness 속성에 유용함을 입증함.

How

Figure 1

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: PsiFit은 multimodal stability foundation model을 contrastive fine-tuning에 통합하는 간결하고 효과적인 방법으로 low-N 단백질 fitness 예측 성능을 유의미하게 개선했으며, 향후 다양한 생물물리학적 prior 통합 연구의 좋은 출발점이 될 것으로 보인다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.91 기준으로 'Learning Protein Fitness Landscapes with Multimodal Stability Priors'의 AI4S 방법론을 'De novo design of protein structure and function with RFdiffusion'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
기반 연구SPECTER2 유사도 0.91 기준으로 'Learning Protein Fitness Landscapes with Multimodal Stability Priors'의 AI4S 방법론을 'Agentic End-to-End De Novo Protein Design for Tailored Dynamics Using a Language Diffusion Model'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
기반 연구구조 기반 안정성 예측 모델을 pLM에 통합하는 이론적 토대가 되는 연구로 보인다.
기반 연구protein language model의 logit 조정 기법에 대한 기초를 제공함
다른 접근단백질 서열로부터 물성을 예측하는 동일한 문제를 foundation model embedding 대신 다른 표현 방식으로 접근한다.
기반 연구설명가능한 모델을 생물학적 서열 설계에 응용하는 유사 사례임
기반 연구SPECTER2 유사도 0.94로 Computational Molecular Design와 AI-Driven Drug and Materials Discovery가 맞닿아, 'FLIP2: Expanding Protein Fitness Landscape Benchmarks for Real-World Machine Learning Applications'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 Computational Molecular Design와 AI-Driven Drug and Materials Discovery가 맞닿아, 'Linear-time prediction of proteome-scale microbial protein interactions'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 Computational Molecular Design와 AI-Driven Drug and Materials Discovery가 맞닿아, 'Benchmarking and Experimental Validation of Machine Learning Strategies for Enzyme Engineering'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.92로 Computational Molecular Design와 LLMs for Molecular Biology & Chemistry가 맞닿아, 'Orthrus: toward evolutionary and functional RNA foundation models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근단백질 fitness 예측을 위한 다른 다중모달 통합 방식을 제안하는 것으로 보인다.
다른 접근sequence-structure 정보 결합을 위한 다른 방법론을 사용함
다른 접근protein fitness 예측을 위한 다른 multimodal 접근법을 제시함
후속 연구ESM2 등 foundation model embedding을 활용한 단백질 물성 예측의 공통 기반을 공유한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드