Patch size and its effect on representations in MAEs

저자: Sivaramakrishnan Sankarapandian, Shivesh Chaudhary, Zhenghao Chen, Jun Xu | 날짜: 2026 | URL: https://openreview.net/forum?id=LkjToPjLa1 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. Left & Middle: MAE pre-training on the MNIST-on-ImageNet benchmark. Smaller patches (top) preserve fine-graine

MAE의 patch size가 인코더가 포착하는 특징의 공간적 스케일을 결정하는 일종의 고역통과 필터(high-pass filter)처럼 작동함을 실증하고, 이를 해결하기 위해 patch size에 대해 adaptive LayerNorm으로 명시적으로 conditioning하는 Mosaic MAE를 제안한다.

Motivation

Achievement

Figure 2

Figure 2. Downstream linear probing performance on clinical

  1. Patch size의 고역통과 필터 효과 실증: p<s일 때 linear probing accuracy가 p>s일 때보다 일관되게 높음을 보여 patch size가 인코딩 가능한 물체의 최소 스케일을 결정함을 확인했다.
  2. Mosaic MAE 제안: FlexiViT의 동적 patch resizing(선형 투영 가중치 및 위치 임베딩의 동적 리사이즈)에 diffusion model/DiT 스타일의 adaptive LayerNorm 조건화를 결합해 self-supervised 생성 모델에 확장했다.
  3. FlexiMAE 대비 우수한 표현력: 명시적 patch-size conditioning이 조건화되지 않은 variable-patch 베이스라인(FlexiMAE)보다 더 나은 downstream representation을 제공함을 clinical DXA 데이터에서 입증했다.

How

Figure 1

Figure 1. Left & Middle: MAE pre-training on the MNIST-on-ImageNet benchmark. Smaller patches (top) preserve fine-graine

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: Patch size가 MAE 표현의 스케일을 결정한다는 직관적이지만 중요한 관찰을 명확한 실험으로 뒷받침하고, 이를 해결하는 실용적인 architecture(Mosaic MAE)를 제안한 점에서 의료 영상 표현 학습에 유의미한 기여를 하는 workshop 논문이다. 다만 발췌된 본문만으로는 정량적 결과와 ablation의 완전성을 판단하기 어렵다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.90로 Scientific Machine Learning for Dynamics와 Scientific AI for Physics and Environment가 맞닿아, 'Scientific discovery in the age of artificial intelligence'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구MAE의 스케일 특성 분석에 기반이 되는 연구로 보임
기반 연구spectral-spatial mixing 기법을 특정 의료영상 분할 문제에 적용한 사례
기반 연구정보기하학 기반 불확실성 추정을 확장 적용한 연구로 판단된다.
기반 연구자연 이미지 사전학습 모델을 의료 영상 도메인에 적용한 유사 사례
기반 연구MAE의 patch 표현 학습에 대한 이론적 기초 제공
다른 접근attention 메커니즘의 대안적 해석 방식을 제안한다는 점에서 유사한 접근을 다루는 논문이다.
기반 연구SPECTER2 유사도 0.92로 Scientific Machine Learning for Dynamics와 AI-Driven Drug and Materials Discovery가 맞닿아, 'Few-Shot Continual Learning for 3D Brain MRI with Frozen Foundation Models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.91로 Scientific Machine Learning for Dynamics와 Molecular Simulation and Generative Modeling가 맞닿아, 'Navigating heterogeneous protein landscapes through geometry-aware smoothing'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근그래프 압축 및 노드 분류를 통한 표현학습 관련 대안적 접근법으로 추정된다.
다른 접근인코더-디코더 비대칭성을 활용한 어댑테이션 기법이라는 점에서 대안적 접근을 제시.
다른 접근patch 표현 학습에 대한 다른 접근법을 제시하는 연구로 보임
후속 연구dyadic encoder-decoder 구조의 기초를 제공한다.
다른 접근뇌 연결성 분석을 위한 유사한 multi-scale 프레임워크를 다룬다.
다른 접근지리적 좌표 인코딩을 위한 다른 위치 인코더 설계 방식을 제안한다.
후속 연구adaptive normalization을 활용한 MAE 확장 연구로 추정됨
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드