LDARNet: DNA Adaptive Representation Network with Learnable Tokenization for Genomic Modeling

저자: Daria Ledneva, Denis Kuznetsov | 날짜: 2026 | URL: https://openreview.net/forum?id=v4hQnJn6aN 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. Model overview. Left: the LDARNet architecture with BiMamba-2 outer layers and a BiMamba-2 backbone operating

LDARNet은 H-Net의 동적 청킹(dynamic chunking) 아이디어를 autoregressive 생성에서 masked language modeling(MLM)으로 확장하여, 고정된 tokenization(k-mer, BPE, single nucleotide) 없이 학습 가능한 경계로 DNA를 계층적으로 표현하는 120M 파라미터 genomic foundation model이다.

Motivation

Achievement

Figure 2

Figure 2. Boundary probabilities around canonical promoter motifs. Mean boundary probability with 95% confidence interva

  1. 성능: Nucleotide Transformer 및 Genomic Benchmarks의 27개 과제에 대한 fine-tuning에서, 300M 파라미터 미만 compact model 중 18개 과제 중 11개에서 우승했으며, 5개 histone modification 과제에서 20배 큰 모델(2.5B 파라미터)을 능가하는 state-of-the-art 성능을 달성했다.
  2. 인과적 검증: FLOPs를 맞춘 통제 실험을 통해 학습된 routing이 성능 향상의 원인임을 입증했다—동일 연산량에서 학습된 경계가 고정 격자 경계보다 histone 과제에서 최대 14.3 percentage point 우수했다.
  3. 생물학적 해석: 뉴클레오타이드 해상도 분석에서 학습된 경계가 비지도 방식으로도 정규 프로모터 모티프 및 splice junction과 정렬됨을 보여, adaptive tokenization의 생물학적 타당성을 제시했다.
  4. 교차종 전이성: NT 벤치마크에서 인간 게놈에 특화 최적화된 유사 규모 모델(1-2/18 승)에 비해 LDARNet이 아키텍처적 일반성을 통해 더 우수한 교차종 전이성(11/18 승)을 유지함을 보였다.

How

Figure 1

Figure 1. Model overview. Left: the LDARNet architecture with BiMamba-2 outer layers and a BiMamba-2 backbone operating

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: H-Net의 동적 청킹을 MLM 패러다임으로 성공적으로 이식하고, FLOPs-matched 실험과 뉴클레오타이드 해상도 분석을 통해 학습된 tokenization의 성능적·생물학적 타당성을 인과적으로 입증한 견고한 연구로, compact genomic foundation model 설계에 실질적 기여를 한다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.94로 Computational Molecular Design와 AI-Driven Drug and Materials Discovery가 맞닿아, 'Effective gene expression prediction from sequence by integrating long-range interactions'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구Transformer 기반 self-attention 메커니즘의 유전체학적 응용 기초를 다룬다.
기반 연구SPECTER2 유사도 0.93로 Computational Molecular Design와 LLMs for Molecular Biology & Chemistry가 맞닿아, 'Language Models for Controllable DNA Sequence Design'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구약물 관련 데이터 기반 실용적 응용 사례로서 유사한 방향성을 가짐
기반 연구bimodal omics 표현 학습을 확장하여 다룬다.
기반 연구동적 청킹 기반 표현 학습의 이론적 기초를 제공하는 연구로 판단됨
후속 연구DNA language model의 tokenization 기법에 대한 이론적 기반을 공유한다.
기반 연구SMILES 기반 다운스트림 태스크 평가를 확장한 실증 연구이다.
기반 연구실시간 추론 지연 최적화의 확장 연구
기반 연구controlled pretraining 방법론을 확장 적용한 연구
기반 연구SPECTER2 유사도 0.95로 Computational Molecular Design와 AI-Driven Drug and Materials Discovery가 맞닿아, 'CLM-X: A multimodal single-cell foundation model with flexible multi-way Transformer for unified scRNA-seq and scATAC-seq analysis'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근멀티모달 단일세포 파운데이션 모델의 다른 아키텍처를 제안한다.
기반 연구SPECTER2 유사도 0.93로 Computational Molecular Design와 AI-Driven Drug and Materials Discovery가 맞닿아, 'Orthrus: toward evolutionary and functional RNA foundation models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근RNA 속성 예측을 위한 다른 모델 구조를 제안한다.
다른 접근RNA/단백질 구조 역설계에서 디코딩 순서 최적화라는 유사한 문제를 다룸
다른 접근대규모 단일세포 데이터 처리를 위한 효율적 표현 학습이라는 공통 목표를 가진다.
다른 접근DNA 서열 표현을 위한 다른 adaptive tokenization 접근으로 보임
후속 연구계층적 autoregressive genomic model의 기반이 되는 아키텍처를 제공한다.
다른 접근genomic foundation model의 레이어별 특성을 분석하는 유사한 해석 연구이다.
다른 접근genomic foundation model의 대규모 사전학습 및 응용이라는 공통 주제를 다룬다.
후속 연구DNA 시퀀스에 대한 적응적 tokenization을 확장 적용한 연구로 보임
후속 연구H-Net의 dynamic chunking 아이디어를 MLM으로 확장하는 관련 연구로 보임
후속 연구PEFT의 기본 방법론(LoRA, adapter 등)을 제공하는 기초 연구
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드