annDNA: Learning Annotation-Aware Genomic Representations via Knowledge Distillation

저자: Hwanseok Sim, Yujin Kim, Soo-Whee Kim, Yeojin Ryu, Joon-Yong An | 날짜: 2026 | URL: https://openreview.net/forum?id=vmpP5SzOFK 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. The annDNA framework. (a) Annotation-aware tokenization for annDNA-seq (sequence-only), annDNA-struct (sequenc

annDNA는 GENCODE와 ENCODE의 기능적 유전체 주석(annotation) 정보를 뉴클레오타이드 토큰에 직접 결합하여 학습하는 annotation-aware pre-training과, 이를 sequence-only student 모델로 전이하는 cross-modal knowledge distillation을 결합한 genomic language model(GLM) 프레임워크이다.

Motivation

Achievement

Figure 2

Figure 2. Experimental results. (a) Pre-training and distillation training curves. (b) t-SNE visualization of genomic re

  1. Annotation-aware 모델의 성능 우위: annDNA-struct와 annDNA-full은 동일한 아키텍처를 가진 sequence-only baseline(annDNA-seq) 대비 variant effect prediction에서 AUROC 기준 15.5% 향상을 달성했다.
  2. Distillation을 통한 효율적 배포: annDNA-distilled는 teacher(annDNA-full) 파라미터의 약 1/3만 사용하면서도 sequence-only baseline 대비 11.2% 성능 향상을 보였고, 추론 시 시퀀스 입력만으로 동작한다.
  3. 다각적 검증: genomic region embedding 분석, variant effect prediction benchmark, attention pattern 분석을 통해 annotation-aware 표현이 embedding 구조 개선과 실제 기능 요소와의 attention 정렬 향상에도 기여함을 입증했다.

How

Figure 1

Figure 1. The annDNA framework. (a) Annotation-aware tokenization for annDNA-seq (sequence-only), annDNA-struct (sequenc

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 주석 정보를 명시적으로 토큰화하고 이를 distillation으로 sequence-only 모델에 전이한다는 아이디어는 간단하지만 효과적이며, GLM의 실용적 배포와 성능 향상을 동시에 달성한 의미 있는 연구이다. 다만 더 폭넓은 downstream task 검증과 concurrent work와의 비교가 보완된다면 기여도가 더욱 명확해질 것이다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.94로 Computational Molecular Design와 AI-Driven Drug and Materials Discovery가 맞닿아, 'Effective gene expression prediction from sequence by integrating long-range interactions'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근유전자 발현 예측을 위한 다른 서열 기반 딥러닝 모델을 제시함.
기반 연구SPECTER2 유사도 0.93로 Computational Molecular Design와 AI-Driven Drug and Materials Discovery가 맞닿아, 'AlphaGenome: advancing regulatory variant effect prediction with a unified DNA sequence model'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 Computational Molecular Design와 LLMs for Molecular Biology & Chemistry가 맞닿아, 'Language Models for Controllable DNA Sequence Design'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구gLM 해석가능성 벤치마크를 확장하여 적용한다.
다른 접근annotation-aware genomic pretraining 기법의 대안적 구현을 제시함.
기반 연구SPECTER2 유사도 0.93로 Computational Molecular Design와 AI-Driven Drug and Materials Discovery가 맞닿아, 'MEIsensor: a deep-learning method for mobile element insertion discovery'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근cross-modal distillation을 통한 sequence-only 모델 전이라는 방법론적 기반을 공유함.
다른 접근foundation model의 representative feature 식별이라는 유사한 목표를 갖는다.
다른 접근DNA 서열에 생물학적 정보를 인코딩하는 유사한 접근 방식을 제안함
다른 접근ESM-2 임베딩 해석을 다른 방식으로 접근함
다른 접근유전체 서열의 주석 정보를 활용한 표현학습이라는 동일 문제를 다룬 밀접한 관련 연구.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드