⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.
라이선스: OpenReview 공개(오픈액세스)
Essence
Figure 1. Method overview and the two metric axes. Left: matched ref/alt forward passes through a frozen genomic FM (NT-
Genomic foundation model(NT-v2, Evo 2)의 layer별 hidden-state shift(‖Δhℓ‖2)를 이용해, 단일 feature 판별력이 가장 높은 representative layer와 joint classifier가 실제로 의존하는 load-bearing layer가 서로 다르다는 것을 보이고, 이 dissociation이 MLM 기반 파이프라인에서 last-layer pooling의 성능 손실로 이어짐을 규명한다.
Motivation
Known: 기존 연구는 genomic foundation model을 평가할 때 모든 layer의 representation을 aggregation하거나(Pearce et al., 2026) 마지막 layer만 사용하는 방식(Dalla-Torre et al., 2024)을 취해왔으며, mechanistic interpretability 연구는 생물학적으로 의미 있는 feature 밀도가 높은 단일 중간 layer를 선택해왔다.
Gap: 어떤 layer가 실제로 joint model이 의존하는 layer인지, 그리고 그 layer가 단일 변수 probe가 가장 강한 신호를 갖는다고 지목하는 layer와 일치하는지를 검증한 연구는 없었다.
Why: variant pathogenicity 예측과 같은 downstream task에서 어느 layer의 representation을 사용할지는 성능에 직접적 영향을 미치며, 표준 관행인 last-layer mean-pooling이 특정 architecture(MLM)에서는 상당한 신호를 놓치고 있음을 실증적으로 보여주기 때문에 실용적·해석적으로 중요하다.
Approach: ClinVar 8,008개 single-nucleotide variant에 대해 ref/alt 시퀀스의 forward pass를 각각 수행하고 variant token 위치에서 layer별 hidden-state 차이의 L2 norm(‖Δhℓ‖2)이라는 training-free scalar를 정의한 뒤, 이를 단일 feature AUROC(representative)와 leave-one-layer-out ablation drop 및 |SHAP|(load-bearing) 두 축으로 분석한다.
Representative-Load-bearing Dissociation 규명: NT-v2와 Evo 2 두 모델 모두에서 최고 단일 feature AUROC를 보이는 layer(representative)와 joint multi-layer classifier가 ablation 시 가장 크게 의존하는 layer(load-bearing)가 서로 다름을 입증했다.
아키텍처 간 depth shift 관찰: representative layer는 두 모델 모두 mid-network에 위치하지만, load-bearing depth는 MLM(NT-v2)에서는 mid-shallow, CLM hybrid(Evo 2)에서는 deep으로 정반대 위치에 나타남을 확인했다.
Downstream 성능 개선: NT-v2에서 1차원 mid-layer scalar(∥∆h15∥2=0.930)가 1024차원 canonical last-layer mean-pool baseline(0.881)을 +0.049 AUROC 초과하는 반면, Evo 2에서는 4096차원 mean-pool(0.961)이 joint ∥∆hℓ∥2 feature(0.926)와 경쟁적임을 보여, 이 비대칭이 MLM 고유의 현상임을 밝혔다.
강건성 검증: 4가지 scalar reduction(cosine, L1, directional projection 등)에 걸쳐 within-model dissociation이 재현되며, bootstrap CI, DeLong test, 3가지 confound control(치환-계층화 AUROC, gene 내 라벨 순열, gene-balanced subsampling)을 모두 통과했다.
각 variant에 대해 frozen genomic FM(NT-v2 500M MLM, Evo 2 7B CLM hyena/attention hybrid)으로 reference와 alternate 시퀀스의 forward pass를 각각 수행
variant token 위치 v에서 layer별 hidden state 차이의 L2 norm ∥∆hℓ∥2 = ∥h_ℓ^alt[v] − h_ℓ^ref[v]∥2 를 계산 (rotation-invariant, head-decoupled, training-free)
representative layer: 각 layer의 ∥∆hℓ∥2를 단일 feature로 사용한 stratified 10-fold logistic regression의 out-of-fold AUROC 최고점
load-bearing layer: L-dim feature 전체를 joint logistic regression에 넣고 leave-one-layer-out ablation으로 AUROC drop이 가장 큰 layer, |SHAP| importance와 교차검증
15개 고침투율 암 관련 유전자의 ClinVar P/LP(3,514) vs B/LB(4,494) variant 8,008개로 평가
canonical 1024차원(NT-v2)/4096차원(Evo 2) last-layer mean-pool baseline과 비교
HyenaDNA-large를 capacity-limited control로 추가 평가(App. K)
Originality
기존 layer-wise probing 연구(logit lens, TunedLens, Tenney et al. 2019, Skean et al. 2025)의 "decodability" 관점을 넘어, "어떤 layer가 joint model에 실제로 의존되는가"라는 load-bearing 개념을 새롭게 조작적으로 정의함
representative(단일 feature AUROC)와 load-bearing(ablation/SHAP)이라는 두 축을 명시적으로 분리하여 genomic FM에서 이들이 일치하지 않음을 최초로 실증
두 서로 다른 아키텍처(MLM vs CLM hybrid)에서 load-bearing depth가 정반대 극단에 위치하는 cross-architectural depth shift를 관찰하며, 이를 인과가 아닌 관찰적 현상으로 신중하게 프레이밍함
training-free, rotation-invariant, head-decoupled 최소 scalar probe(∥∆hℓ∥2)를 설계하여 fine-tuning 없이 진단 가능하게 함
Limitation & Further Study
연구 범위가 단일 task(variant pathogenicity), 두 개의 주요 모델(NT-v2, Evo 2)과 하나의 capacity-limited control(HyenaDNA)로 제한되어 일반화 가능성이 제한적
objective(MLM vs CLM), capacity, architecture가 두 모델 간 동시에 달라지므로 cross-architectural depth shift에 대한 인과적 결론을 내릴 수 없으며 저자들도 이를 관찰적(observational)이라고 명시
linear readout(logistic regression)만 사용하여 non-linear 관계나 더 복잡한 downstream head에서도 동일한 결과가 성립하는지는 미검증
후속 연구로는 더 많은 architecture 및 task(예: expression, splicing 예측)에 대한 검증, 그리고 depth shift의 원인(objective vs architecture vs capacity)을 분리하는 controlled ablation 연구가 필요
기반 연구SPECTER2 유사도 0.92 기준으로 'Representative vs. Load-bearing Layers: A Dissociation in Genomic Foundation Models'의 AI4S 방법론을 'Gemma 2: Improving open language models at a practical size'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
기반 연구SPECTER2 유사도 0.92 기준으로 'Representative vs. Load-bearing Layers: A Dissociation in Genomic Foundation Models'의 AI4S 방법론을 'OLMo: Accelerating the Science of Language Models'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.
기반 연구SPECTER2 유사도 0.92로 Computational Molecular Design와 AI-Driven Drug and Materials Discovery가 맞닿아, 'AlphaGenome: advancing regulatory variant effect prediction with a unified DNA sequence model'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.92로 Computational Molecular Design와 AI-Driven Drug and Materials Discovery가 맞닿아, 'Agentic Discovery of Exchange-Correlation Density Functionals'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.