Skipping the Zeros in Diffusion Models for Sparse Data Generation
저자: Phil Ostheimer, Mayank Nagda, Andriy Balinskyy, Gabriel Vicente Rodrigues, Jean Radig, Carl Herrmann, Stephan Mandt, Marius Kloft, Sophie Fellenz | 날짜: 2026 | URL: https://openreview.net/forum?id=Fqhwxyh4VN📄 PDF
⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.
라이선스: OpenReview 공개(오픈액세스)
Essence
Figure 1. Sparsity preservation on MNIST. While dense models
Diffusion models(DMs)이 sparse continuous data에서 exact zero를 보존하지 못하고 불필요한 연산을 수행하는 문제를 지적하고, non-zero 값만을 인코딩·디퓨전·디코딩하는 Sparsity-Exploiting Diffusion(SED)을 제안하여 sparsity를 보존하면서 계산 효율을 높인다.
Motivation
Known: DMs(DDPM, LDM 등)은 이미지, 오디오, 텍스트 등 dense continuous data 생성에서 state-of-the-art 성능을 보이며, latent diffusion 및 discrete diffusion, sparsity-aware DM 등 다양한 변형이 존재한다. Rate-distortion 분석과 sparse matrix format(CSR/CSC), zero-skipping attention 기법도 알려져 있다.
Gap: 기존 DM들은 모든 차원을 dense하게 처리하기 때문에 particle physics, scRNA sequencing 등에서 의미 있는 exact zero(신호의 부재)를 보존하지 못하고, zero 차원에 대해서도 불필요한 gradient 업데이트와 denoising 연산을 수행하여 계산 자원을 낭비한다. 기존 sparsity-aware DM은 binary indicator를 추가해 입력 크기를 두 배로 늘리면서도 여전히 모든 차원에 대해 denoising을 수행한다.
Why: 물리학(입자 검출기 데이터), 생물학(scRNA sequencing), 추천 시스템 등 현실 세계의 많은 데이터가 고차원이면서 실수값을 가지고 매우 sparse하기 때문에, sparsity 패턴을 정확히 보존하면서 효율적으로 생성할 수 있는 모델은 해석가능성, 신뢰성, 다운스트림 활용성 측면에서 중요한 실용적 가치를 갖는다.
Approach: SED는 sparsity-aware autoencoder를 이용해 non-zero 값만을 compact latent representation으로 인코딩하고, 이 latent space에서 dense diffusion을 수행한 뒤, autoregressive하게 dimension-value 쌍을 복원하는 방식으로 sparsity를 보존하면서 non-zero 개수에 비례하는 계산 비용을 달성한다.
Achievement
Figure 2. SED keeps computational cost nearly constant for gen-
Sparsity 보존: MNIST 실험에서 DDPM, LDM과 같은 dense 모델이 sparsity 패턴을 훼손하는 것과 달리 SED는 ground truth와 밀접하게 일치하는 sparsity 패턴을 보존함을 시각적으로 입증했다.
계산 효율성: scRNA 데이터에서 active gene 수를 고정한 채 전체 차원을 늘려도 SED의 상대적 FLOPS는 거의 일정하게 유지되는 반면, DDPM과 LDM은 전체 차원 수에 비례해 계산 비용이 증가함을 보였다.
성능 우위: physics 및 biology 벤치마크에서 SED가 domain-specific 베이스라인 및 표준 DM과 동등하거나 이를 능가하는 생성 품질을 달성했다.
분석적 통찰: rate-distortion curve 분석을 통해 dense DM이 zero 차원에 낮은 rate를 할당함에도 불구하고 여전히 전체 차원에 대해 연산을 수행하는 근본적 비효율성을 규명했다.
How
Figure 4. The proposed SED processes only non-zero values for efficient sparse data generation. Overview of SED applied
Section 2에서 rate-distortion curve 분석을 통해 dense DM(DDPM)이 zero 차원과 non-zero 차원에 서로 다른 rate를 할당하지만 연산은 모든 차원에 걸쳐 수행됨을 실증적으로 보임
Autoregressive sparse decoding 전략을 도입하여 dimension-value 쌍을 non-zero entry에 대해서만 생성
Physics(calorimeter/detector 데이터), Biology(scRNA sequencing), Vision(MNIST) 등 세 도메인에서 벤치마크 평가 수행, domain-specific 베이스라인(예: Dirac delta mass 기반 모델) 및 표준 DDPM/LDM과 비교
Originality
기존 sparse continuous data 생성 연구(Lu et al., 2019/2021)가 zero 위치에 대한 사전 지식(spiral sampling 등)에 의존하는 것과 달리, SED는 이러한 prior 지식 없이 sparsity 패턴을 학습적으로 처리
기존 sparsity-aware DM(Ostheimer et al., 2025)이 binary sparsity indicator를 추가하여 입력 차원을 두 배로 늘리고도 여전히 dense하게 처리하는 것과 정반대로, SED는 zero 차원을 diffusion 이전에 아예 제거하여 연산량을 non-zero 개수에 비례하도록 만듦
discrete DM은 exact zero를 효율적으로 생성할 수 있지만 실수값 non-zero magnitude를 표현할 수 없는 한계가 있는 반면, SED는 continuous 값과 sparsity를 동시에 다루는 하이브리드 접근을 제시
LDM의 point cloud/3D shape 생성 연구가 고정된 개수의 점을 다루는 것과 달리, SED는 가변적인 sparsity 수준에서 non-zero 값만 생성하고 나머지는 zero로 채우는 방식을 취함
Limitation & Further Study
발췌된 본문에서는 autoregressive decoding 전략의 구체적인 오더링(ordering) 방식이나 non-zero 개수 자체를 어떻게 예측하는지에 대한 세부 사항이 명확히 드러나지 않아, 가변 sparsity 수준을 처리하는 메커니즘의 안정성에 대한 추가 검증이 필요할 수 있음
Autoregressive decoding은 본질적으로 순차적 특성을 가지므로, non-zero 개수가 매우 많은 경우 병렬화 이점이 제한되어 실제 wall-clock 시간 이득이 FLOPS 절감만큼 크지 않을 가능성이 있음
물리학, 생물학, 비전 등 특정 도메인 벤치마크에 초점을 맞추고 있어, 추천 시스템처럼 이산적 특성이 강한 sparse 데이터나 훨씬 더 극단적인 sparsity 비율을 가진 데이터에 대한 일반화 가능성은 추가 검증이 필요함
후속 연구로 sparsity 패턴 자체의 불확실성 모델링이나 non-zero 개수 예측의 정확도 개선, 그리고 attention 기반 zero-skipping 기법과의 결합을 통한 추가 효율화를 고려할 수 있음
총평: Sparse continuous data 생성이라는 실용적으로 중요하지만 상대적으로 덜 다뤄진 문제를 rate-distortion 분석을 통해 명확히 진단하고, non-zero 값만 처리하는 direct하면서도 효과적인 해법(SED)을 제시한 견고한 연구이다. 물리학, 생물학, 비전 등 다양한 도메인에서의 실증 결과가 방법의 실용성과 일반성을 뒷받침한다.
기반 연구SPECTER2 유사도 0.92로 Clinical Time-Series Modeling와 Scientific AI for Physics and Environment가 맞닿아, 'A multimodal generative AI copilot for human pathology'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.92 기준으로 'Skipping the Zeros in Diffusion Models for Sparse Data Generation'의 AI4S 방법론을 'AI for Science 2025'의 과학 생산·평가 맥락과 함께 보면 연구 자동화의 의미를 입체적으로 볼 수 있다.