GENEB: Why Genomic Models Are Hard to Compare

저자: Daria Ledneva, Mikhail Nuridinov, Denis Kuznetsov | 날짜: 2026 | URL: https://openreview.net/forum?id=uZerXmyozE 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 2

GENEB는 40개 genomic foundation model을 100개 태스크(13개 기능 범주)에 걸쳐 통일된 probing 기반 프로토콜로 평가하는 대규모 진단형 벤치마크로, 모델 간 직접 비교가 불가능했던 기존 평가 관행의 파편화 문제를 해결하고자 한다.

Motivation

Achievement

Figure 2
  1. 대규모 통합 벤치마크 구축: 40개 genomic foundation model과 100개 태스크(13개 기능 범주)를 아우르는 최초의 대규모 통일 평가 프레임워크 GENEB를 제시하여 NLP 분야의 MTEB에 상응하는 역할을 genomic ML에 부여함.
  2. 집계 리더보드의 불안정성 실증: 모델 순위가 태스크 범주에 따라 크게 달라지며, 단일 aggregate 순위표가 신뢰할 수 없음을 정량적으로 보임.
  3. Scale-Performance Disconnect 발견: 모델 크기와 성능 간 유의미한 상관관계(ρ=0.565, EVO-1-131K 제외 시 ρ=0.685)가 있음에도, 36개 in-domain 모델 중 31개 사례에서 5배 이상 작은 모델이 더 큰 모델을 능가함을 확인.
  4. 범주별 scaling correlation 분석: 13개 기능 범주 각각에 대해 모델 크기와 성능 간 상관관계를 개별적으로 산출하여 아키텍처·pretraining alignment가 파라미터 수보다 중요할 수 있음을 밝힘.

How

Figure 5

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: GENEB는 파편화된 genomic foundation model 평가 생태계에 절실히 필요했던 통일적이고 대규모의 진단 벤치마크를 제공하며, aggregate leaderboard의 불안정성과 scale-performance 관계의 복잡성을 실증적으로 드러낸 의미 있는 기여이다. 다만 probing 기반 평가의 한계와 태스크 유형의 편중은 향후 확장이 필요한 지점으로 남는다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.93로 Computational Molecular Design와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'MedAgentGym: A Scalable Agentic Training Environment for Code-Centric Reasoning in Biomedical Data Science'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구라운드별 데이터 활용을 확장한 후속 연구
다른 접근다수의 genomic 모델을 비교 평가하는 벤치마크라는 점에서 확장 관계에 있다.
기반 연구SPECTER2 유사도 0.93로 Computational Molecular Design와 AI-Driven Drug and Materials Discovery가 맞닿아, 'What Topological and Geometric Structure Do Biological Foundation Models Learn?'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 Computational Molecular Design와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'LifeSciBench: Evaluating Language Models on Realistic, Expert-Level Tasks in the Life Sciences'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근genomic 모델 평가 프로토콜의 파편화 문제를 다룬다는 공통 주제를 갖는다.
다른 접근genomic model 비교를 위한 다른 진단적 평가 방식을 제안한다.
다른 접근genomic foundation model의 표준화된 벤치마킹이라는 동일한 문제의식을 공유한다.
후속 연구genomic model 평가 태스크 범위를 확장한다.
후속 연구의미보존 변환 기반 평가 방법론의 이론적 기초를 제공한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드