Predicting host-pathogen interactions using a proteome-scale language model

저자: Cyril Malbranke, Cecilia Fruet, Anne-Florence Bitbol | 날짜: 2026 | URL: https://openreview.net/forum?id=faHMTX8CnE 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. Main results and ablations for ProteomeLM-HPI. A: Mean logistic regression AUROC (HPI vs. random cross-species

ProteomeLM의 attention coefficients가 비지도 방식으로 종간 host-pathogen interaction(HPI) 신호를 이미 포착하고 있음을 보이고, LoRA 기반 경량 미세조정(ProteomeLM-HPI)을 통해 이를 증폭시켜 엄격한 cross-species benchmark에서 성능을 향상시킨다.

Motivation

Achievement

Figure 1

Figure 1. Main results and ablations for ProteomeLM-HPI. A: Mean logistic regression AUROC (HPI vs. random cross-species

  1. 무감독 HPI 신호 확인: 미세조정 없이 base ProteomeLM의 attention head만으로 10종 pathogen에 걸쳐 평균 AUROC 0.786을 달성하여, 단일 proteome 학습만으로도 종간 HPI 신호가 자연스럽게 나타남을 입증.
  2. ProteomeLM-HPI 설계: asymmetric masking(pathogen-heavy masking)과 blocked pathogen self-attention을 결합한 LoRA 기반 경량 미세조정을 통해 평균 AUROC를 0.796까지 향상시킴.
  3. 엄격한 일반화 벤치마크에서 검증: pathogen-level holdout과 40% 서열 동일성 필터링을 적용한 cross-species benchmark에서 10개 미확인 pathogen 중 9개에서 AUC를 개선.
  4. 기존 벤치마크와 비교: Tsukiyama et al. (2021) virus-human PPI benchmark에서 AUPR=0.986, F1=0.923으로 경쟁력 있는 성능 확보.

How

Figure 1

Figure 1. Main results and ablations for ProteomeLM-HPI. A: Mean logistic regression AUROC (HPI vs. random cross-species

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 단일 종 proteome 학습만으로 종간 host-pathogen interaction 신호가 자연스럽게 나타난다는 흥미로운 발견을 바탕으로, 경량 미세조정을 통해 엄격한 일반화 벤치마크에서 실질적 성능 향상을 보인 견실한 workshop-level 연구이다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.91 기준으로 'Predicting host-pathogen interactions using a proteome-scale language model'의 AI4S 방법론을 'Boltz-1 Democratizing Biomolecular Interaction Modeling'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
기반 연구생물학적 언어모델의 사전학습 및 표현 학습에 대한 기초적 방법론을 공유함
기반 연구대규모 생물학적 데이터셋에 language model을 적용한 유사 응용이다.
응용 사례종간 상호작용 예측에 실제 적용된 사례
기반 연구SPECTER2 유사도 0.91 기준으로 'Predicting host-pathogen interactions using a proteome-scale language model'의 AI4S 방법론을 'What Topological and Geometric Structure Do Biological Foundation Models Learn?'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
기반 연구SPECTER2 유사도 0.93로 Computational Molecular Design와 AI-Driven Drug and Materials Discovery가 맞닿아, 'Bacterial proteome foundation model enhances functional prediction from enzymes to ecological interactions'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구게놈 문맥 학습을 위한 파운데이션 모델의 방법론적 토대를 제공함.
기반 연구SPECTER2 유사도 0.92로 Computational Molecular Design와 LLMs for Molecular Biology & Chemistry가 맞닿아, 'Orthrus: toward evolutionary and functional RNA foundation models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근세포 교란 반응 예측에서 딥러닝과 baseline 비교라는 유사한 문제를 다룬다.
다른 접근단백질 상호작용 예측이라는 동일 문제를 다루지만 PPI candidate ranking이라는 다른 응용에 초점을 맞춤
다른 접근생물학적 언어모델의 표현 학습이라는 유사한 목표를 다른 상호작용 예측 맥락에서 다룸
다른 접근단백질 상호작용 예측을 위한 다른 attention 기반 접근법을 다룬다.
다른 접근engineered protein variant에 대한 PFM embedding 활용이라는 유사한 방법론을 공유한다.
다른 접근숙주-병원체 상호작용 예측의 다른 접근법
후속 연구ESM 기반 서열 임베딩 기법의 이론적 기반을 제공한다.
후속 연구attention coefficient를 활용한 비지도 신호 포착 방법을 확장
응용 사례단백질 상호작용 모델링을 host-pathogen 문제에 응용하는 유사 사례이다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드