dnaHNet: A Scalable and Hierarchical Foundation Model for Genomic Sequence Learning

저자: Arnav Shah, Junzhe Li, Parsa Idehpour, Adibvafa Fallahpour, Brandon Wang, Sukjun Hwang, BO WANG, Patrick D Hsu, Hani Goodarzi, Albert Gu | 날짜: 2026 | URL: https://openreview.net/forum?id=6pN2KNCspk 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

dnaHNet는 고정 어휘 tokenizer 없이 raw nucleotide 서열을 미분 가능한 dynamic chunking으로 압축·모델링하는 계층적 autoregressive genomic foundation model로, StripedHyena2 대비 뛰어난 scaling·효율성과 zero-shot 성능을 달성한다.

Motivation

Achievement

Figure 4
  1. Scaling 및 효율성 우위: 10M부터 1B 파라미터 규모까지 dnaHNet을 GTDB(Genome Taxonomy Database) 상의 원핵생물 genome corpus에 pretrain하여 광범위한 scaling law 분석을 수행했고, Evo 2의 근간인 StripedHyena2 대비 우수한 효율성을 입증했다.
  2. 연산량 절감 및 추론 속도 향상: 재귀적 압축이 main network의 FLOP 비용을 quadratic하게 줄여 Transformer 대비 3배 이상의 inference speedup을 달성했다.
  3. 안정적 계층 학습을 위한 학습 레시피 확립: compression ratio scheduling, encoder-decoder balancing, initialization 전략 등 genomic data에서의 안정적인 hierarchical learning에 필요한 최적 학습 체제와 architecture 수정사항을 규명했다.
  4. Zero-shot 다운스트림 성능: MaveDB의 실험적 fitness 데이터를 이용한 protein variant effect prediction과 in silico perturbation 기반 gene essentiality classification에서 state-of-the-art zero-shot 성능을 달성했다.
  5. 생물학적으로 의미 있는 비지도 tokenization 발견: dnaHNet이 codon, promoter, intergenic region 등 기능적 영역에 적응하는 context-dependent tokenization을 감독 없이 스스로 학습함을 보였다.

How

Figure 2

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: tokenizer-free하면서 계산 효율성과 생물학적 해석 가능성을 동시에 확보한 dnaHNet은 genomic foundation model 설계에 새로운 방향을 제시하는 견고한 연구이나, 진핵생물로의 확장성과 더 폭넓은 baseline 비교가 후속 검증되어야 완전한 신뢰를 얻을 수 있을 것이다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.93로 Computational Molecular Design와 AI-Driven Drug and Materials Discovery가 맞닿아, 'Effective gene expression prediction from sequence by integrating long-range interactions'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 Computational Molecular Design와 AI-Driven Drug and Materials Discovery가 맞닿아, 'Sequence modeling and design from molecular to genome scale with Evo'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 Computational Molecular Design와 AI-Driven Drug and Materials Discovery가 맞닿아, 'Genome modeling and design across all domains of life with Evo 2'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구sample-efficient 생성 전략을 확장하여 적용한 연구로 보임
기반 연구계층적 autoregressive genomic model의 기반이 되는 아키텍처를 제공한다.
다른 접근DNA 서열 표현을 위한 다른 adaptive tokenization 접근으로 보임
다른 접근적은 파라미터로 시퀀스 모델링 성능을 달성하는 비신경망 접근을 공유함
다른 접근생물학적 서열 생성을 위한 promptable 언어모델의 대안적 구조를 다룸
다른 접근메타지노믹 파운데이션 모델에서 유사한 아키텍처 비교 접근을 취하는 대안적 연구로 보인다.
응용 사례dynamic chunking 기법을 실제 게놈 서열 모델링에 적용한 사례이다.
다른 접근frozen self-supervised representation을 활용한 다운스트림 태스크 적응 방법론이 유사함
다른 접근genomic foundation model의 tokenization 개선이라는 동일한 문제를 다루는 관련 연구
다른 접근동일한 게놈 언어 모델 tokenization 문제를 다른 아키텍처로 접근한 연구이다.
후속 연구genomic language model의 압축 및 정보량 분석을 확장한 연구이다.
다른 접근동일하게 dynamic chunking을 이용한 tokenization 대안을 제시한다.
후속 연구언어모델의 역공학적 해석 방법론의 이론적 기초를 제공한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드