Token-Wise Residual Latent Adapters: Steering Seq2Seq Models for Protein Fitness Extrapolation
저자: Steven Wu, Mostafa Karimi, Sharmi Banerjee, Peng Gao, Jonah Noh, Jiachen Li, Robert Jiang, Bella Dubrov, Shang Shang, Hao Song | 날짜: 2026 | URL: https://openreview.net/forum?id=ZUBNaqRSDL📄 PDF
⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.
라이선스: OpenReview 공개(오픈액세스)
Essence
Figure 1. Overview of RLA approach for protein fitness extrapolation.
frozen ProtT5-3B 인코더-디코더 사이에 5M 파라미터의 token-wise residual latent adapter를 삽입하여 단순 MSE objective만으로 단백질 fitness extrapolation을 수행하는 경량화 접근법을 제안한다.
Motivation
Known: 기존 SOTA 방법들은 DPO with data distillation처럼 billion-parameter 언어모델 전체를 fine-tuning하며, 외부 scorer와 다단계 iterative refinement를 결합해 강력한 extrapolation 성능을 달성한다. LoRA 같은 parameter-efficient 대안도 있으나 대체로 full fine-tuning보다 extrapolation 품질이 떨어진다.
Gap: 기존 latent-space 방법들(e.g., LatProtRL)은 토큰 임베딩을 pooled sequence-level representation으로 집약한 뒤 업데이트를 적용하거나 RL policy를 학습하는데, 이는 positional alignment를 잃고 복잡한 학습 파이프라인을 요구한다. Position-preserving하면서도 supervised objective만으로 학습 가능한 경량 latent steering 방법은 부재했다.
Why: 단백질 설계는 본질적으로 training 분포 밖의 higher-fitness 영역으로 extrapolation해야 하는 문제이며, 이를 위해 billion-parameter 모델 전체를 fine-tuning하는 것은 계산·데이터 비용이 크다. 훨씬 적은 파라미터로 동등하거나 더 나은 extrapolation 성능을 얻을 수 있다면 in-silico 단백질 설계의 실용성과 접근성이 크게 향상된다.
Approach: 인코더-디코더 T5 백본을 완전히 freeze한 채, 인코더 임베딩에 대해 position별로 독립 적용되는 residual MLP adapter를 삽입하고, lower-fitness와 higher-fitness 시퀀스 쌍의 임베딩 간 MSE loss만으로 이 adapter를 학습시킨다.
Achievement
Figure 2. Distribution of predicted fitness values for all scorer-free methods. The dashed line indicates the extrapolat
파라미터 효율성: 약 5M 파라미터(전체 3B 모델의 약 1/600)만 학습하면서도 외부 scorer, data distillation, iterative refinement 없이 단일 forward pass로 강력한 extrapolation 성능을 달성했다.
어려운 벤치마크에서 큰 향상: AAV Hard에서 14.17 fitness / 78.92% extrapolation(EXO 대비 10.95 / 52.75%), GFP Hard에서 3.94 fitness / 97.94% extrapolation(EXO 대비 2.81 / 24.27%)을 기록하며 특히 어려운 split에서 가장 큰 이득을 보였다.
Ground truth 근접성: 4개 벤치마크 중 3개에서 가장 낮은 distance-to-ground-truth를 달성했다.
데이터 효율성: 학습 데이터 쌍의 10-20%만으로도 extrapolation 성능이 포화(saturate)됨을 보였다.
How
Figure 2. Distribution of predicted fitness values for all scorer-free methods. The dashed line indicates the extrapolat
frozen ProtT5-3B 인코더 E(·)와 디코더 D(·) 사이에 residual latent adapter Aφ를 삽입, h′_t = h_t + Aφ(h_t) 형태로 각 position t에 독립적으로 적용
lower-fitness 시퀀스 x−와 higher-fitness 시퀀스 x+ 쌍에 대해, E(x−)의 임베딩을 E(x+)의 임베딩 쪽으로 회귀시키는 position-wise MSE loss L(ϕ)로 adapter만 학습(인코더·디코더는 완전 고정)
동일 길이의 substitution mutation 쌍만 지원(insertion/deletion 미지원), dropout으로 정규화
AAV, GFP 데이터셋의 medium/hard split(각각 6, 7 mutation 거리)에서 기존 연구와 동일한 split 사용
Full fine-tuning, LoRA, DPO+data distillation, random-init negative control 등과 비교
Extrapolation Percentage, Fitness100, Distance100, Diversity100 네 가지 지표로 평가, 5개 독립 seed에 대한 mean±std 보고
Originality
인코더-디코더 사이 latent space에서 token-wise(position-preserving) residual transformation을 학습하는 adapter 구조를 제안, 기존의 pooled sequence-level 업데이트나 RL policy 기반 접근(LatProtRL)과 차별화
activation addition, contrastive steering vector와 같은 고정된 residual steering 개념을 학습 가능하고 position-conditioned nonlinear 형태로 일반화
외부 scorer, data distillation, iterative refinement 등 기존 SOTA 파이프라인의 복잡한 구성요소 없이 단일 forward pass + 단순 MSE objective만으로 경쟁력 있는 성능을 달성한다는 점에서 실용적 독창성 보유
Limitation & Further Study
MSE loss가 position-wise로 계산되므로 x−, x+ 시퀀스 길이가 동일해야 하며, 현재 방법은 substitution mutation만 지원하고 insertion/deletion을 다루지 못함
GFP Medium split에서는 extrapolation 성능이 EXO 대비 크게 낮아(37.01% vs 92.92%) 특정 latent 분포 특성(더 diffuse한 extrapolation 영역)에서는 단일 방향의 residual shift가 효과적이지 않을 수 있음을 시사
평가된 fitness 값이 evaluator model의 예측치에 의존하므로 실제 wet-lab 검증이 부재하며, 벤치마크가 AAV/GFP 두 단백질 계열에 한정되어 일반화 가능성 검증이 추가로 필요
후속 연구로 다양한 단백질 패밀리, indel을 포함한 가변 길이 mutation, 그리고 실제 실험적 검증을 통한 방법의 강건성 확인이 요구됨
총평: 단순한 아이디어(latent space에서의 token-wise residual adapter)를 통해 600배 적은 파라미터로 SOTA에 필적하거나 능가하는 extrapolation 성능을 보여준 실용적이고 인상적인 연구이나, GFP Medium에서의 성능 저하와 substitution-only 제약, wet-lab 검증 부재는 추가 검토가 필요하다.
기반 연구SPECTER2 유사도 0.94로 Computational Molecular Design와 Scientific Information Extraction and QA가 맞닿아, 'Gemma 2: Improving open language models at a practical size'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.94로 Computational Molecular Design와 Scientific Information Extraction and QA가 맞닿아, 'State-Free Inference of State-Space Models: The Transfer Function Approach'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.