⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.
라이선스: OpenReview 공개(오픈액세스)
Essence
Figure 1. MOJO pipeline. (a) Each modality is first tokenized using linear binning. (b) MOJO, whose core architecture is
bulk RNA-seq와 DNA methylation을 정렬 및 토큰화한 뒤 convolution과 transformer를 결합한 아키텍처로 bimodal masked language modeling을 수행하여, 두 omics의 joint representation을 학습하는 MOJO 모델을 제안한다.
Motivation
Known: Transformer 기반 foundation model이 genomics, single-cell transcriptomics, bulk RNA-seq 등 다양한 omics 데이터에 대해 self-supervised language modeling으로 유용한 embedding을 학습할 수 있음이 알려져 있다. 또한 multi-modal omics 통합은 주로 late integration(Kronecker product, cross-attention 등) 방식으로 이루어져 왔다.
Gap: 기존 transformer 기반 모델은 attention의 quadratic memory scaling으로 인해 Ngenes~10^4 규모의 긴 시퀀스를 다루는 bulk RNA-seq와 DNA methylation을 함께 다루기 어렵고, 두 modality를 정렬하여 joint하게 표현을 학습하는 방법이 부재하며, 임상 현실에서 흔한 missing modality 상황에서 성능 저하 문제가 충분히 해결되지 않았다.
Why: RNA-seq와 DNA methylation은 암 진단 및 예후 예측에서 상보적으로 중요한 정보를 제공하므로, 이 둘을 효율적으로 통합한 foundation model은 cancer-type classification, survival analysis 등 임상 응용에서 성능과 실용성을 동시에 높일 수 있다.
Approach: gene 단위로 두 modality를 정렬하고 linear binning으로 토큰화한 후, convolution과 attention을 혼합한 아키텍처로 bimodal masked language modeling을 통해 사전학습하고, mutual information 기반 auxiliary loss로 missing modality에 강건한 fine-tuning 프레임워크를 도입한다.
Achievement
Figure 4. Ovarian cancer sub-typing: MOJO outperforms BulkRN-
MOJO 모델 제안: bulk RNA-seq와 DNA methylation의 bimodal masked language modeling을 통해 joint representation을 학습하는 MOJO(Multi-Omics JOint representation learning)를 제시했다.
메모리 효율적 장거리 아키텍처: convolution과 transformer 블록을 결합하여 Ngenes~10^4 규모의 긴 시퀀스에서도 순수 transformer 대비 메모리 부담을 줄였다.
SOTA 성능 달성: pan-cancer cancer-type classification, survival analysis, cancer subtype clustering 등 다양한 다운스트림 태스크에서 unimodal 모델 대비 state-of-the-art 성능을 보였다.
Missing modality에 대한 강건성: mutual information 기반 auxiliary loss를 활용한 학습 프레임워크로 modality가 누락되어도 성능을 유지했다.
Array-agnostic 및 OOD 일반화: gene-level aggregation 덕분에 legacy Illumina 27k 플랫폼에 대해 재학습 없이 zero-shot 전이가 가능했고, 외부 held-out cohort에서도 bimodal 이점이 유지됨을 확인했다.
How
Figure 1. MOJO pipeline. (a) Each modality is first tokenized using linear binning. (b) MOJO, whose core architecture is
Modality alignment: RNA-seq 값(log10(1+x) 변환)과 methylation beta value를 Infinium Human Methylation 450k annotation을 기반으로 gene 단위로 정렬하여 Xmeth를 계산(단순 평균 방식이 region-weighted 방식과 동등하거나 더 나은 성능을 보임을 확인).
Tokenization: 각 modality 값을 64개의 bin으로 linear binning하여 토큰 시퀀스로 변환.
아키텍처: 각 토큰을 embedding layer로 변환 후 gene embedding(positional encoding 역할)과 합산, convolution과 attention block을 혼합한 구조로 장거리 의존성을 효율적으로 처리.
Missing modality 강건화: Ramazanova et al. (2025)의 test-time adaptation 아이디어를 차용해 mutual information 기반 auxiliary loss를 fine-tuning 단계에 추가.
Originality
RNA-seq와 DNA methylation을 gene 단위로 정렬하여 단일 bimodal sequence로 결합한 뒤 masked language modeling으로 joint pretraining하는 접근은 기존 late integration 방식과 차별화된다.
convolution과 transformer를 결합해 고차원 omics 시퀀스의 메모리 문제를 해결하는 아키텍처 설계는 genomics 분야의 장거리 모델링 기법을 multi-omics 통합에 처음으로 적용한 사례이다.
mutual information 기반 auxiliary loss를 활용한 missing modality 강건 학습 프레임워크와, gene-level aggregation을 통한 array-agnostic zero-shot 전이는 실용적 임상 적용성을 크게 높이는 독창적 기여이다.
Limitation & Further Study
논문 발췌 내용만으로는 정량적 성능 수치(구체적 AUC, C-index 등)와 baseline과의 비교 세부사항이 충분히 제시되지 않아 성능 우위의 정도를 명확히 판단하기 어렵다.
TCGA 데이터셋에 크게 의존하고 있어, 다양한 인종/기관/시퀀싱 플랫폼 간 이질성에 대한 일반화 가능성은 두 개의 held-out cohort로만 검증되어 제한적이다.
bulk RNA-seq와 DNA methylation 두 modality에 국한되어 있어, genomics(mutation), 영상, 임상 텍스트 등 추가 modality로의 확장성은 후속 연구 과제로 남아 있다.
gene-level aggregation을 위한 weighting 전략(단순 평균 vs region-weighted)의 선택 근거가 제한된 벤치마크에만 기반해 다른 암종이나 methylation platform에서 일반화되는지 추가 검증이 필요하다.
총평: bulk RNA-seq와 DNA methylation을 효율적으로 통합하는 아키텍처와 missing modality에 강건한 학습 프레임워크를 함께 제시한 실용적이고 완성도 높은 연구로, multi-omics foundation model 분야에 의미 있는 기여를 한다.
기반 연구SPECTER2 유사도 0.93로 Computational Molecular Design와 AI-Driven Drug and Materials Discovery가 맞닿아, 'Effective gene expression prediction from sequence by integrating long-range interactions'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.94로 Computational Molecular Design와 AI-Driven Drug and Materials Discovery가 맞닿아, 'CLM-X: A multimodal single-cell foundation model with flexible multi-way Transformer for unified scRNA-seq and scATAC-seq analysis'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.92로 Computational Molecular Design와 AI-Driven Drug and Materials Discovery가 맞닿아, 'CrossLLM-Mamba: Multimodal State Space Fusion of LLMs for RNA Interaction Prediction'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.