Rethinking Genomic Modeling Through Optical Character Recognition

저자: Hongxin Xiang, Pengsen Ma, Yunkang Cao, Di Yu, Haowen Chen, Xinyu Yang, xiangxiang Zeng | 날짜: 2026 | URL: https://openreview.net/forum?id=nggzekChuU 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 2

Figure 2. Overview of OpticalDNA. (a) Render a 1D genomic sequence into a multi-page DNA document with bounding-box anno

DNA 서열을 1차원 토큰이 아닌 2차원 문서 이미지로 렌더링하여, OCR 스타일의 vision-language model로 학습함으로써 희소하고 불연속적인 유전체 신호를 효율적으로 압축·이해하는 OpticalDNA 프레임워크를 제안한다.

Motivation

Achievement

Figure 1

Figure 1. From sequential reading to selective genomic scanning. (a) Sparse, discontinuous genomic signals make sequenti

  1. 패러다임 전환: genomic sequence modeling을 OCR 스타일의 document understanding 문제로 재정의한 최초의 프레임워크(OpticalDNA)를 제안했다.
  2. 효율적 압축: 최대 450k bases 서열에서 약 20배 적은 effective token으로 최고 성능을 달성하여, 이해 기반 압축이 실제로 작동함을 입증했다.
  3. 파라미터 효율성: 최대 985배 더 많은 activated parameter를 가진 모델들을 능가하면서도 단 256k개의 trainable parameter만 튜닝했다.
  4. 정합성 검증: OCR의 grounding, retrieval, span completion이 각각 variant localization, subsequence retrieval, missing-interval inference와 자연스럽게 대응됨을 보이고, 이를 활용한 6가지 OCR-inspired task를 설계했다.
  5. 경험적 우위 확인: 2D CNN backbone이 1D CNN baseline보다 accuracy-efficiency trade-off에서 명확히 우수함을 eQTL 예측 등에서 controlled comparison으로 확인했다(Fig. 1c).

How

Figure 2

Figure 2. Overview of OpticalDNA. (a) Render a 1D genomic sequence into a multi-page DNA document with bounding-box anno

Originality

Limitation & Further Study

Evaluation

Novelty: 5/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: DNA를 이미지 문서로 취급하고 OCR 기법을 적용한다는 발상은 매우 독창적이며 효율성과 성능 면에서 설득력 있는 결과를 보여주지만, 렌더링 설계의 일반화 가능성과 세부 실험적 근거에 대한 추가 검증이 뒷받침되면 더욱 견고한 기여가 될 것이다.

같이 보면 좋은 논문

기반 연구OCR 스타일 vision-language model의 기본 아키텍처를 제공한다.
기반 연구vision-language model을 이용한 서열 표현 학습의 기초 연구.
기반 연구SPECTER2 유사도 0.92로 Multimodal Biomedical Data Fusion와 Scientific Information Extraction and QA가 맞닿아, 'S1-MMAlign: A Large-Scale, Multi-Disciplinary Dataset for Scientific Figure-Text Understanding'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근DNA 서열을 다른 modality로 표현하여 학습하는 대안적 genomic modeling 접근법.
후속 연구AnyRes tiling 기법의 방법론적 기초를 공유한다.
후속 연구OCR 스타일 학습을 유전체 데이터에 확장 적용한 연구.
후속 연구1차원 시퀀스를 2차원 이미지로 변환하는 아이디어를 확장 적용한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드