저자: Akira A Nair, Jaehyun Joo, Jonghyun Lee, Lina Takemaru, Yidi Huang, Manu Shivakumar, Matthew Eric Lee, Jaesik Kim, Sokratis Apostolidis, Dokyoon Kim | 날짜: 2026 | URL: https://openreview.net/forum?id=boBP35BB2U 📄 PDF
Essence
Figure 1. Summary of workflow. DNA sequences are passed into the gLM, and embeddings are extracted. These embeddings are
Evo2와 같은 genomic language model(gLM)의 내부 표현을 해석하기 위해 sparse autoencoders(SAEs)를 체계적으로 적용하고, 이를 평가할 수 있는 genomic annotation 벤치마크와 해석가능성 지표를 제시한 연구이다. 또한 SAE feature들을 조직화하는 graph 기반 표현 방법을 제안하여 질병 관련 유전 변이 분석에 활용 가능함을 보인다.
Evaluation
Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5
총평: gLM 해석가능성이라는 상대적으로 미개척 영역에서 SAE를 체계적으로 적용하고 검증한 견고한 실증 연구로, 벤치마크와 방법론적 기여가 향후 genomic AI 해석가능성 연구의 중요한 토대가 될 것으로 평가된다.
같이 보면 좋은 논문
기반 연구SPECTER2 유사도 0.93로 Computational Molecular Design와 AI-Driven Drug and Materials Discovery가 맞닿아, 'Sequence modeling and design from molecular to genome scale with Evo'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.92로 Computational Molecular Design와 LLMs for Molecular Biology & Chemistry가 맞닿아, 'AlphaGenome: advancing regulatory variant effect prediction with a unified DNA sequence model'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 Computational Molecular Design와 AI-Driven Drug and Materials Discovery가 맞닿아, 'Genome modeling and design across all domains of life with Evo 2'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구sparse autoencoder를 이용한 표현 해석의 방법론적 기초를 제공한다.
다른 접근variant 정보를 활용한 genomic 모델 개선이라는 공통 목표를 가짐
기반 연구genomic foundation model의 내부 표현 분석을 확장한다.
후속 연구SAE 기반 해석가능성 벤치마크를 확장하여 적용함
기반 연구genomic model 평가 태스크 범위를 확장한다.
기반 연구tokenizer alignment 및 property explanation을 실제 응용에 적용한 사례로 보임
기반 연구SPECTER2 유사도 0.93로 Computational Molecular Design와 AI-Driven Drug and Materials Discovery가 맞닿아, 'BioReason-Pro: Advancing Protein Function Prediction with Multimodal Biological Reasoning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근annotation-aware genomic pretraining 기법의 대안적 구현을 제시함.
후속 연구gLM 해석가능성 벤치마크를 확장하여 적용한다.
다른 접근유전체 서열 분석을 위한 다른 딥러닝 접근을 제시한다.
다른 접근genomic language model 해석을 sparse autoencoder 외의 다른 기법으로 시도한다.
후속 연구DNA/유전체 서열 모델링의 기초가 되는 언어모델 아키텍처를 제공하는 연구