TadA-Bench: A Million-Variant Benchmark for Future-Round Discovery Toward Agentic Protein Engineering

저자: Jin Gao, Juntu Zhao, Zirui Zeng, Jiaqi Shen, Junhao Shi, Dukun Zhao, Yuming Lu, Dequan Wang | 날짜: 2026 | URL: https://openreview.net/forum?id=KMwrxaoAW4 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. TadA-Bench overview. The benchmark frames protein engineering as fixed-data future-round discovery: models obs

TadA-Bench는 31라운드에 걸친 TadA directed evolution 실험 데이터를 활용해, 이전 라운드 데이터로 이후 라운드 변이체의 활성을 예측·순위화하는 future-round discovery 벤치마크를 제안하며, Seq2Graph라는 그래프 기반 라벨 통합 파이프라인으로 노이즈가 많은 다중 라운드 enrichment 측정치를 일관된 활성 라벨로 정제한다.

Motivation

Achievement

Figure 4

Figure 4. Random-split interpolation versus fixed future-round evaluation on the protein view of TadA-Bench. The top and

  1. TadA-Bench 벤치마크 구축: 31라운드, million-variant 규모의 wet-lab replay 벤치마크를 구축하고 DNA/RNA/protein aligned view와 고정된 future-round split을 제공한다.
  2. Seq2Graph 라벨 통합 파이프라인 개발: within-round ranking과 cross-round shared-variant anchor를 활용해 노이즈가 많은 다중 라운드 enrichment 측정치를 그래프 기반으로 통합, 일관된 활성 스코어를 산출한다.
  3. 모델 한계 규명: 대표적 biological language model들이 random-split에서는 강한 상관관계(interpolation)를 보이지만 future-round ranking과 finite-budget 후보 선택에서는 크게 성능이 저하됨을 보였으며, full fine-tuning과 prompt tuning 등의 적응 기법으로도 이 격차가 해소되지 않음을 확인했다.
  4. 데이터 구성 원리에 대한 통제 실험 결과 도출: 동일 규모 조건에서 local data density보다 evolutionary coverage가 future-round discovery 성능에 더 유의미한 정보를 제공함을 실증했다.

How

Figure 2

Figure 2. Seq2Graph constructs a unified activity scale from multi-round TadA sequencing data. (a) NGS enrichment within

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 실제 wet-lab 캠페인의 시간적 구조를 보존하며 future-round discovery라는 실용적이고 중요한 문제를 정면으로 다룬 견고한 벤치마크 논문으로, agentic protein engineering 연구에 실질적인 기여를 할 것으로 평가되나 단일 캠페인 기반이라는 한계로 일반화 검증은 향후 과제로 남는다.

같이 보면 좋은 논문

기반 연구단백질 공학 워크플로우 자동화를 확장한 연구
다른 접근future-round discovery 벤치마크 설계라는 유사한 목표를 가진 연구
기반 연구leakage 제거된 벤치마크 데이터셋을 유사한 목적으로 구축함
기반 연구대규모 유전체 데이터셋 활용을 확장하여 다룬다.
기반 연구conformal prediction을 단백질 설계 캠페인에 적용한 유사 연구
응용 사례future-round discovery 벤치마크의 실제 실험 데이터 응용
기반 연구Bradley-Terry 기반 preference 학습을 확장한 관련 연구로 보인다.
기반 연구SPECTER2 유사도 0.94로 Computational Molecular Design와 Agentic AI for Scientific Automation가 맞닿아, 'PersonaAI: An Interactive Agentic-AI Framework for Autonomous Hypothesis Generation and Validation in Aging'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.94로 Computational Molecular Design와 AI-Driven Drug and Materials Discovery가 맞닿아, 'What Topological and Geometric Structure Do Biological Foundation Models Learn?'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근생물학 파운데이션 모델의 내부 구조를 다른 관점에서 분석하는 유사 연구이다.
다른 접근생물학적 태스크에서 LLM 에이전트의 추론 능력을 평가하는 유사한 벤치마크 연구임.
다른 접근그래프 기반 표현학습을 단백질 변이체 예측에 적용한 유사 방법론
다른 접근directed evolution 데이터 기반 변이체 예측의 대안적 접근
후속 연구대규모 생물정보학 데이터/파이프라인 구축의 기반을 제공한다.
다른 접근다수의 genomic 모델을 비교 평가하는 벤치마크라는 점에서 확장 관계에 있다.
후속 연구라운드별 데이터 활용을 확장한 후속 연구
다른 접근LLM 기반 실험 설계 최적화라는 유사 문제의 대안적 접근이다.
후속 연구대규모 생물학적 서열/구조 데이터셋 구축의 방법론적 기반을 공유한다.
후속 연구역할극 기반 multi-agent 시스템의 이론적 기초를 공유한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드