dnaHNet: A Scalable and Hierarchical Foundation Model for Genomic Sequence Learning
저자: Arnav Shah, Junzhe Li, Parsa Idehpour, Adibvafa Fallahpour, Brandon Wang, Sukjun Hwang, BO WANG, Patrick D Hsu, Hani Goodarzi, Albert Gu | 날짜: 2026 | URL: https://openreview.net/forum?id=6pN2KNCspk📄 PDF
⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.
라이선스: OpenReview 공개(오픈액세스)
Essence
dnaHNet는 고정 어휘 tokenizer 없이 raw nucleotide 서열을 미분 가능한 dynamic chunking으로 압축·모델링하는 계층적 autoregressive genomic foundation model로, StripedHyena2 대비 뛰어난 scaling·효율성과 zero-shot 성능을 달성한다.
Motivation
Known: Nucleotide Transformer, Evo/Evo2 등 대규모 genomic foundation model은 k-mer나 BPE 같은 고정 tokenization 혹은 nucleotide-level 해상도 중 하나를 택해왔으며, HyenaDNA·Mamba·StripedHyena 같은 subquadratic architecture로 긴 context 문제를 일부 해결해왔다.
Gap: 고정 tokenization은 codon, 조절 요소 등 생물학적으로 의미 있는 motif를 임의로 분절시키고, nucleotide-level 모델은 생물학적 일관성은 유지하나 긴 context에 대한 계산 비용이 지나치게 크다는 근본적 tradeoff가 미해결로 남아 있으며, dynamic chunking이 genomic sequence에서 생물학적으로 의미 있는 segmentation을 발견하고 기존 architecture보다 효율적으로 scaling하며 SOTA DNA foundation model을 능가할 수 있는지는 검증되지 않았다.
Why: tokenizer-free하면서도 계산 효율적인 genomic foundation model은 disease diagnosis, drug discovery, synthetic biology 등에 직접 활용될 수 있는 해석 가능하고 확장 가능한 차세대 genomic modeling 프레임워크의 기반이 될 수 있다.
Approach: H-Net architecture를 기반으로, raw nucleotide를 재귀적·계층적인 differentiable dynamic chunking mechanism을 통해 latent token으로 적응적으로 압축하며 end-to-end로 autoregressive하게 학습한다.
Achievement
Scaling 및 효율성 우위: 10M부터 1B 파라미터 규모까지 dnaHNet을 GTDB(Genome Taxonomy Database) 상의 원핵생물 genome corpus에 pretrain하여 광범위한 scaling law 분석을 수행했고, Evo 2의 근간인 StripedHyena2 대비 우수한 효율성을 입증했다.
연산량 절감 및 추론 속도 향상: 재귀적 압축이 main network의 FLOP 비용을 quadratic하게 줄여 Transformer 대비 3배 이상의 inference speedup을 달성했다.
안정적 계층 학습을 위한 학습 레시피 확립: compression ratio scheduling, encoder-decoder balancing, initialization 전략 등 genomic data에서의 안정적인 hierarchical learning에 필요한 최적 학습 체제와 architecture 수정사항을 규명했다.
Zero-shot 다운스트림 성능: MaveDB의 실험적 fitness 데이터를 이용한 protein variant effect prediction과 in silico perturbation 기반 gene essentiality classification에서 state-of-the-art zero-shot 성능을 달성했다.
생물학적으로 의미 있는 비지도 tokenization 발견: dnaHNet이 codon, promoter, intergenic region 등 기능적 영역에 적응하는 context-dependent tokenization을 감독 없이 스스로 학습함을 보였다.
How
H-Net의 differentiable dynamic chunking mechanism을 도입해 raw nucleotide 서열을 latent token으로 압축, compression 비율과 예측 정확도 사이의 균형을 학습하도록 설계
압축 과정을 재귀적·계층적으로 여러 단계 적용하여 genomic information의 중첩된(nested) 구조를 모방
10M~1B 파라미터 규모의 다수 모델을 GTDB의 원핵생물 genome corpus로 pretrain하여 scaling behavior를 체계적으로 분석
StripedHyena2, Transformer 등 기존 architecture와 inference FLOPs 및 evaluation perplexity를 비교하는 scaling law 실험 수행
MaveDB 기반 protein variant fitness 예측, Evo 2 기반 in silico perturbation을 통한 gene essentiality 분류 등 zero-shot downstream task로 평가
학습된 chunk 경계를 분석하여 codon, 조절 요소 등과의 대응 여부를 비지도적으로 검증
Originality
기존 dynamic tokenization 연구(MergeDNA, PatchDNA, MxDNA 등)가 tokenization-then-modeling 패러다임에 머물러 있는 것과 달리, segmentation과 representation 학습을 완전히 end-to-end로 결합한 최초의 genomic 적용 사례
H-Net의 hierarchical chunking을 genomic sequence에 적용하여 재귀적 압축을 통한 계층적 생물학적 구조(코돈-유전자-조절요소 등) 발견 가능성을 실증
StripedHyena2 기반 Evo 2와 직접 비교하여 tokenizer-free 접근이 fixed-vocabulary 및 nucleotide-level 접근 모두의 한계를 동시에 극복할 수 있음을 대규모 scaling law로 입증
Limitation & Further Study
본문 발췌에는 pretraining이 원핵생물(prokaryotic) genome에 국한되어 있어, 진핵생물(eukaryotic)의 훨씬 복잡한 splicing, intron/exon 구조, epigenetic regulation 등에 대한 일반화 가능성은 검증되지 않음
StripedHyena2 등 일부 baseline과의 비교에 초점이 맞춰져 있어 다른 최신 tokenizer-free 또는 dynamic tokenization 방법(MergeDNA, PatchDNA, MxDNA)과의 직접적 정량 비교가 부족할 가능성
Zero-shot 평가가 protein variant fitness와 gene essentiality에 한정되어 있어, 유전자 발현 예측, chromatin state 예측 등 더 폭넓은 downstream task에 대한 일반화는 추가 검증 필요
향후 연구로 진핵생물 genome, multi-species pretraining, 더 큰 모델 규모로의 확장, 그리고 discovered hierarchical structure의 생물학적 해석에 대한 심층 분석이 요구됨
총평: tokenizer-free하면서 계산 효율성과 생물학적 해석 가능성을 동시에 확보한 dnaHNet은 genomic foundation model 설계에 새로운 방향을 제시하는 견고한 연구이나, 진핵생물로의 확장성과 더 폭넓은 baseline 비교가 후속 검증되어야 완전한 신뢰를 얻을 수 있을 것이다.
기반 연구SPECTER2 유사도 0.93로 Computational Molecular Design와 AI-Driven Drug and Materials Discovery가 맞닿아, 'Effective gene expression prediction from sequence by integrating long-range interactions'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 Computational Molecular Design와 AI-Driven Drug and Materials Discovery가 맞닿아, 'Sequence modeling and design from molecular to genome scale with Evo'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 Computational Molecular Design와 AI-Driven Drug and Materials Discovery가 맞닿아, 'Genome modeling and design across all domains of life with Evo 2'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.