BioToken and BioFM – Biologically-Informed Tokenization Enables Accurate and Efficient Genomic Foundation Models

저자: Aleksandr Medvedev, Karthik Viswanathan, Praveenkumar Kanithi, Kirill Vishniakov, Prateek Munjal, Clement Christophe, Tiago Magalhaes, Marco AF Pimentel, Ronnie Rajan, Shadab Khan | 날짜: 2026 | URL: https://openreview.net/forum?id=Vmt2iPfH5z 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. BioFM integrates biologically-informed tokenization, significantly outperforming GFMs and specialized models a

DNA를 단순 뉴클레오티드 서열로 취급하는 기존 genomic foundation model(GFM)의 한계를 극복하기 위해, variant 및 생물학적 annotation을 서열에 직접 인코딩하는 tokenization 프레임워크 BioToken과 이를 기반으로 한 파라미터 효율적 모델 BioFM을 제안한다.

Motivation

Achievement

Figure 1

Figure 1. BioFM integrates biologically-informed tokenization, significantly outperforming GFMs and specialized models a

  1. BioToken 제안: SNV/insertion을 위한 변이 토큰(Ǎ, Č, Ť, Ǧ)과 transcript/exon/CDS 경계를 나타내는 annotation 토큰을 도입하여 DNA 서열에 생물학적 context를 직접 인코딩하는 모듈형 tokenization 프레임워크를 제시하였다.
  2. BioFM 개발: 265M 파라미터의 decoder-only transformer로, Nucleotide Transformer(2.5B), Evo(40B) 등 기존 대규모 GFM 대비 약 100배 적은 compute로 학습되었음에도 우수한 성능을 달성하였다.
  3. 성능 우위 입증: Variant Benchmark, DART, TraitGym LR Benchmark 등 여러 벤치마크에서 BioFM이 Evo2-1B, Evo2-7B, Caduceus, NT-500M-v2-MS 등 기존 최첨단 모델 및 Enformer와 같은 특화 baseline을 능가하는 AUROC를 달성하였다.
  4. Annotation의 효과 검증: 동일한 크기와 compute를 가진 nucleotide-only 모델(ACGT-265M)과 비교하여, annotation을 추가한 BioFM이 네 개 variant effect 벤치마크에서 유의미한 성능 향상을 보임으로써 biological inductive bias의 효과를 입증하였다.

How

Figure 2

Figure 2. Extensive evaluation shows that BioFM excels at modeling variants and efficiently using genomic context for su

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 생물학적 annotation을 tokenization 단계에서 명시적으로 통합하는 아이디어는 간단하지만 효과적이며, 100배 적은 compute로 대형 GFM을 능가하는 실용적 성과를 보여준 점에서 의미 있는 연구이나, 사전학습 데이터 규모와 annotation 범위의 제한은 향후 확장이 필요한 지점이다.

같이 보면 좋은 논문

기반 연구BioBERT 기반 표현을 실제 생의학 NLP 태스크에 적용함
기반 연구SPECTER2 유사도 0.92로 Computational Molecular Design와 AI-Driven Drug and Materials Discovery가 맞닿아, 'Effective gene expression prediction from sequence by integrating long-range interactions'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 Computational Molecular Design와 AI-Driven Drug and Materials Discovery가 맞닿아, 'Developing ChemDFM as a large language foundation model for chemistry'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 Computational Molecular Design와 AI-Driven Drug and Materials Discovery가 맞닿아, 'LLM4GRN: Discovering causal gene regulatory networks with llms–evaluation through synthetic data generation'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구생물학적 정보를 인코딩하는 tokenization의 이론적 기초를 제공한다.
기반 연구BioToken의 생물학적 정보 인코딩 기법을 scRNA-seq 클러스터링에 응용할 수 있는 관계이다.
기반 연구대사공학 도메인에 KG 기반 foundation model을 적용한 유사 사례임
기반 연구genomic foundation model의 토큰화 및 표현 학습에 대한 이론적 기반을 공유한다.
다른 접근DNA 서열에 생물학적 정보를 인코딩하는 유사한 접근 방식을 제안함
다른 접근genomic foundation model의 tokenization 개선이라는 동일한 문제를 다루는 관련 연구
다른 접근DNA 서열 기반 예측 모델이라는 공통된 방법론을 사용한다.
다른 접근DNA 서열 기반 foundation model이라는 유사한 목표를 다른 아키텍처로 접근함
다른 접근variant 정보를 포함한 유전체 표현 학습이라는 유사한 문제를 다룬다.
후속 연구genomic foundation model 활용을 위한 핵심 방법론적 기반이 된다.
다른 접근variant 정보를 활용한 genomic 모델 개선이라는 공통 목표를 가짐
후속 연구sparse autoencoder를 이용한 표현 해석의 방법론적 기초를 제공한다.
다른 접근분자를 LLM 친화적 문자열로 표현하는 다른 방법을 제안하는 연구로 보임
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드