scDataset: Scalable Data Loading for Deep Learning on Large-Scale Single-Cell Omics

저자: Davide D'Ascenzo, Sebastiano Cultrera di Montesano | 날짜: 2026 | URL: https://openreview.net/forum?id=NiqWdmrxwn 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. scDataset bridges diverse data backends with PyTorch’s DataLoader through a modular interface. Data retrieval

단일세포(single-cell) 오믹스 데이터셋처럼 수억 개 세포 규모의 디스크 상주 데이터를 딥러닝 학습에 효율적으로 로딩하기 위해, block sampling과 batched fetching을 결합한 quasi-random sampling 기법인 scDataset이라는 PyTorch data loader를 제안한다.

Motivation

Achievement

Figure 2

Figure 2. Data loading throughput on AnnData as a function of

  1. 속도 향상: Tahoe-100M(1억 세포) 데이터셋에서 AnnData 파일을 직접 다루면서도 true random sampling 대비 두 자릿수 이상(100배 이상)의 처리량 향상을 달성했다.
  2. 이론적 보장: block size와 fetch factor에 따른 기대 minibatch entropy(다양성)에 대한 명시적 이론적 상한/하한을 유도했다.
  3. 다양성 재현: 실험적으로 scDataset이 true random sampling과 구별되지 않는 수준의 minibatch entropy를 회복함을 보였다.
  4. 다운스트림 성능 유지: 여러 classification task와 model architecture에서 scDataset이 true random sampling과 동등한 정확도를 유지하면서 end-to-end 학습 시간을 대폭 단축했다.

How

Figure 3

Figure 3. Effect of fetch factor on streaming throughput from Ann-

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 단일세포 오믹스 분야에서 실질적으로 시급한 데이터 로딩 병목 문제를 이론과 실험 양면에서 견고하게 해결한 실용적이고 완성도 높은 시스템 논문이다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.90로 LLM Agent Reasoning Training와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'BiasFilter: An inference-time debiasing framework for large language models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구디스크 상주 대규모 데이터 학습의 효율성 기법에 대한 기반을 제공한다.
기반 연구SPECTER2 유사도 0.90로 LLM Agent Reasoning Training와 Molecular Simulation and Generative Modeling가 맞닿아, 'SamplingDesign: RNA design via continuous optimization with coupled variables and Monte-Carlo sampling'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.90로 LLM Agent Reasoning Training와 AI-Driven Drug and Materials Discovery가 맞닿아, 'Scalable Cross-Facility Federated Learning for Scientific Foundation Models on Multiple Supercomputers'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근대규모 데이터셋 처리 효율화라는 유사한 문제를 다룸
다른 접근단일세포 오믹스 데이터의 대규모 처리를 위한 유사한 데이터 로딩/샘플링 접근법을 다룸
다른 접근대규모 단일세포 데이터 로딩을 위한 다른 샘플링 전략을 제안하는 대안적 연구이다.
후속 연구batched fetching 기법을 확장하여 적용한 연구이다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드