Bimodal masked language modeling for bulk RNA-seq and DNA methylation representation learning

저자: Maxence Gélard, Hakim Benkirane, Thomas Pierrot, Guillaume Richard, Paul-Henry Cournède | 날짜: 2026 | URL: https://openreview.net/forum?id=fi4gh4Syka 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. MOJO pipeline. (a) Each modality is first tokenized using linear binning. (b) MOJO, whose core architecture is

bulk RNA-seq와 DNA methylation을 정렬 및 토큰화한 뒤 convolution과 transformer를 결합한 아키텍처로 bimodal masked language modeling을 수행하여, 두 omics의 joint representation을 학습하는 MOJO 모델을 제안한다.

Motivation

Achievement

Figure 4

Figure 4. Ovarian cancer sub-typing: MOJO outperforms BulkRN-

  1. MOJO 모델 제안: bulk RNA-seq와 DNA methylation의 bimodal masked language modeling을 통해 joint representation을 학습하는 MOJO(Multi-Omics JOint representation learning)를 제시했다.
  2. 메모리 효율적 장거리 아키텍처: convolution과 transformer 블록을 결합하여 Ngenes~10^4 규모의 긴 시퀀스에서도 순수 transformer 대비 메모리 부담을 줄였다.
  3. SOTA 성능 달성: pan-cancer cancer-type classification, survival analysis, cancer subtype clustering 등 다양한 다운스트림 태스크에서 unimodal 모델 대비 state-of-the-art 성능을 보였다.
  4. Missing modality에 대한 강건성: mutual information 기반 auxiliary loss를 활용한 학습 프레임워크로 modality가 누락되어도 성능을 유지했다.
  5. Array-agnostic 및 OOD 일반화: gene-level aggregation 덕분에 legacy Illumina 27k 플랫폼에 대해 재학습 없이 zero-shot 전이가 가능했고, 외부 held-out cohort에서도 bimodal 이점이 유지됨을 확인했다.

How

Figure 1

Figure 1. MOJO pipeline. (a) Each modality is first tokenized using linear binning. (b) MOJO, whose core architecture is

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: bulk RNA-seq와 DNA methylation을 효율적으로 통합하는 아키텍처와 missing modality에 강건한 학습 프레임워크를 함께 제시한 실용적이고 완성도 높은 연구로, multi-omics foundation model 분야에 의미 있는 기여를 한다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.93로 Computational Molecular Design와 AI-Driven Drug and Materials Discovery가 맞닿아, 'Effective gene expression prediction from sequence by integrating long-range interactions'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구LLM을 활용한 병리 리포트 분석이라는 유사한 응용 영역을 다룬다.
응용 사례bulk RNA-seq와 methylation 데이터 결합 표현을 실제 태스크에 응용한다.
기반 연구bimodal masked language modeling 방법론이 본 연구의 기반이 된다.
기반 연구변이 영향 예측 문제에 유사 해석가능성 기법을 적용함
기반 연구SPECTER2 유사도 0.94로 Computational Molecular Design와 AI-Driven Drug and Materials Discovery가 맞닿아, 'CLM-X: A multimodal single-cell foundation model with flexible multi-way Transformer for unified scRNA-seq and scATAC-seq analysis'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.92로 Computational Molecular Design와 AI-Driven Drug and Materials Discovery가 맞닿아, 'CrossLLM-Mamba: Multimodal State Space Fusion of LLMs for RNA Interaction Prediction'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.92로 Computational Molecular Design와 LLMs for Molecular Biology & Chemistry가 맞닿아, 'Orthrus: toward evolutionary and functional RNA foundation models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
후속 연구RNA-seq과 DNA methylation의 결합 학습을 확장하는 유사한 시도이다.
후속 연구bimodal omics 표현 학습을 확장하여 다룬다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드