ProtQueSt: Query-Conditioned Retrieval-Augmented Generation for Protein Function Annotation

저자: Linrui Ma, Yiwei Liang, Yishu Yu, Chuhan Joyce Qi | 날짜: 2026 | URL: https://openreview.net/forum?id=YKMnLFmkiv 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. ProtQueSt Architecture. (A) A structure-aware retriever fuses ESM-2 and ProstT5 embeddings for query-independe

ProtQueSt는 단백질 서열로부터의 기능 주석을 단일 고정 매핑이 아닌 query-conditioned retrieval 문제로 재정의하고, structure-aware retriever와 FiLM 기반 query-conditioned contrastive retriever를 결합한 hybrid retrieval-augmented generation 프레임워크를 제안한다.

Motivation

Achievement

Figure 5

Figure 5. Per-task Entity-BLEU by merging strategy (n=256,

  1. Entity-BLEU 최고 성능: Prot-Inst-OOD 벤치마크에서 Entity-BLEU 48.79를 달성하여 RAPM 대비 +37% 향상되었으며, LLM-as-a-judge 점수도 최고치를 기록했다.
  2. FiLM과 query-pooled negative sampling의 상호 필수성 입증: 두 요소 중 하나만 적용할 경우 structural baseline 대비 성능 향상이 없고, 둘을 함께 적용해야만 유의미한 개선이 나타남을 실험적으로 확인했다.
  3. Structure-aware unified retriever 설계: ESM-2와 ProstT5 임베딩을 가중 코사인 융합(α=0.7)으로 결합해 RAPM의 dual-key(MMseqs2 + ESM-2) 파이프라인을 단일 dense score로 대체했다.
  4. Hybrid retrieval 프레임워크 제안: structural retriever와 query-conditioned contrastive retriever의 상위-K 후보를 budget-matched(5+5)로 병합하여 LLM 프롬프트에 제공하는 실용적 추론 파이프라인을 구축했다.

How

Figure 1

Figure 1. ProtQueSt Architecture. (A) A structure-aware retriever fuses ESM-2 and ProstT5 embeddings for query-independe

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 단백질 기능 주석을 query-conditioned retrieval 문제로 재정의하고 FiLM 기반 contrastive retriever와 structure-aware retriever를 결합하여 state-of-the-art 성능을 달성한 실용적이고 참신한 연구로, 다만 단일 벤치마크에 대한 검증과 메커니즘의 이론적 분석 보강이 필요하다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.92 기준으로 'ProtQueSt: Query-Conditioned Retrieval-Augmented Generation for Protein Function Annotation'의 AI4S 방법론을 'PubMedQA: A Dataset for Biomedical Research Question Answering'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
기반 연구SPECTER2 유사도 0.92로 Computational Molecular Design와 LLMs for Molecular Biology & Chemistry가 맞닿아, 'AutoProteinEngine: A Large Language Model Driven Agent Framework for Multimodal AutoML in Protein Engineering'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.92 기준으로 'ProtQueSt: Query-Conditioned Retrieval-Augmented Generation for Protein Function Annotation'의 AI4S 방법론을 'HiPerRAG: High-performance retrieval augmented generation for scientific insights'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
기반 연구단백질 서열 기반 검색의 공통 기초 방법론을 다룬다.
다른 접근protein language model의 zero-shot 성능 향상을 위한 다른 아키텍처 접근을 제시한다.
기반 연구구조 기반 유전자 발현 예측을 실제 응용에 적용한 연구이다.
다른 접근단백질 기능 주석 문제를 다른 retrieval 방식으로 접근한다.
기반 연구SPECTER2 유사도 0.92로 Computational Molecular Design와 AI-Driven Drug and Materials Discovery가 맞닿아, 'BioReason-Pro: Advancing Protein Function Prediction with Multimodal Biological Reasoning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 Computational Molecular Design와 AI-Driven Drug and Materials Discovery가 맞닿아, 'Co-designing sequence and structure of functional de novo enzymes with EnzyGen2'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.92로 Computational Molecular Design와 AI-Driven Drug and Materials Discovery가 맞닿아, 'Linear-time prediction of proteome-scale microbial protein interactions'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근단백질 기능 주석을 위한 다른 검색 기반 방법을 사용한다.
다른 접근단백질 표현학습을 다른 목적(상호작용 예측)에 활용한다.
다른 접근동일한 단백질 기능 검색 문제를 late interaction 방식으로 다루는 대안적 접근법이다.
응용 사례기능 주석 예측을 실제 단백질 설계 검증에 적용한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드