저자: Aleksandr Medvedev, Karthik Viswanathan, Praveenkumar Kanithi, Kirill Vishniakov, Prateek Munjal, Clement Christophe, Tiago Magalhaes, Marco AF Pimentel, Ronnie Rajan, Shadab Khan | 날짜: 2026 | URL: https://openreview.net/forum?id=Vmt2iPfH5z 📄 PDF
Essence
Figure 1. BioFM integrates biologically-informed tokenization, significantly outperforming GFMs and specialized models a
DNA를 단순 뉴클레오티드 서열로 취급하는 기존 genomic foundation model(GFM)의 한계를 극복하기 위해, variant 및 생물학적 annotation을 서열에 직접 인코딩하는 tokenization 프레임워크 BioToken과 이를 기반으로 한 파라미터 효율적 모델 BioFM을 제안한다.
Evaluation
Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5
총평: 생물학적 annotation을 tokenization 단계에서 명시적으로 통합하는 아이디어는 간단하지만 효과적이며, 100배 적은 compute로 대형 GFM을 능가하는 실용적 성과를 보여준 점에서 의미 있는 연구이나, 사전학습 데이터 규모와 annotation 범위의 제한은 향후 확장이 필요한 지점이다.
같이 보면 좋은 논문
기반 연구BioBERT 기반 표현을 실제 생의학 NLP 태스크에 적용함
기반 연구SPECTER2 유사도 0.92로 Computational Molecular Design와 AI-Driven Drug and Materials Discovery가 맞닿아, 'Effective gene expression prediction from sequence by integrating long-range interactions'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 Computational Molecular Design와 AI-Driven Drug and Materials Discovery가 맞닿아, 'Developing ChemDFM as a large language foundation model for chemistry'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 Computational Molecular Design와 AI-Driven Drug and Materials Discovery가 맞닿아, 'LLM4GRN: Discovering causal gene regulatory networks with llms–evaluation through synthetic data generation'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구생물학적 정보를 인코딩하는 tokenization의 이론적 기초를 제공한다.
기반 연구BioToken의 생물학적 정보 인코딩 기법을 scRNA-seq 클러스터링에 응용할 수 있는 관계이다.
기반 연구대사공학 도메인에 KG 기반 foundation model을 적용한 유사 사례임
기반 연구genomic foundation model의 토큰화 및 표현 학습에 대한 이론적 기반을 공유한다.
다른 접근DNA 서열에 생물학적 정보를 인코딩하는 유사한 접근 방식을 제안함
다른 접근genomic foundation model의 tokenization 개선이라는 동일한 문제를 다루는 관련 연구
다른 접근DNA 서열 기반 예측 모델이라는 공통된 방법론을 사용한다.
다른 접근DNA 서열 기반 foundation model이라는 유사한 목표를 다른 아키텍처로 접근함
다른 접근variant 정보를 포함한 유전체 표현 학습이라는 유사한 문제를 다룬다.
후속 연구genomic foundation model 활용을 위한 핵심 방법론적 기반이 된다.
다른 접근variant 정보를 활용한 genomic 모델 개선이라는 공통 목표를 가짐
후속 연구sparse autoencoder를 이용한 표현 해석의 방법론적 기초를 제공한다.
다른 접근분자를 LLM 친화적 문자열로 표현하는 다른 방법을 제안하는 연구로 보임