Active Flow Expansion for Out-of-Distribution Discovery: from Theory to Molecules

저자: Riccardo De Santi, Bruce D Lee, Cristian Perez Jensen, Kimon Protopapas, Sophia Tang, Cheng-Hao Liu, Pranam Chatterjee, Yisong Yue, Andreas Krause | 날짜: 2026 | URL: https://openreview.net/forum?id=KRFAMxxagT 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. (left) Pre-trained flow model µθ0 generates with sufficient probability a set Ωτ

본 논문은 flow/diffusion 모델의 사전학습이 관측 데이터 분포에만 매칭되어 valid design space의 극히 일부만 커버한다는 한계를 지적하고, 모델의 생성 가능 영역(generable set)을 valid design space 전체로 확장하는 새로운 학습 원리인 generable set expansion을 제안한다. 이를 구현하는 continued pre-training 방법인 Active Flow Expansion (ACTFLOW)을 제시하고 이론적 보장과 분자·펩타이드·단백질 도메인에서의 실증 결과를 보인다.

Motivation

Achievement

Figure 1

Figure 1. (left) Pre-trained flow model µθ0 generates with sufficient probability a set Ωτ

  1. Generable set 개념 도입: τ-level generable set Ωτ_θ = {x : p^θ_1(x) ≥ τ}를 정의하여 모델이 non-negligible probability로 커버하는 영역을 수학적으로 포착하고, 표준 pre-training의 근본 한계(Ωτ_θpre ⊂ Ω, Vol(Ωτ_θpre) ≪ Vol(Ω))를 formal하게 규명함.
  2. 새로운 학습 원리 제시: distribution matching(pθ_1 ≈ pdata) 대신 generable set expansion(Ωτ_θ ≈ Ω*)이라는 OOD flow modeling을 위한 학습 목표를 새롭게 정식화함.
  3. ACTFLOW 알고리즘: verifier feedback과 학습된 diffusion representation의 중간 noise level에서의 active exploration을 활용하여 self-generated synthetic data로 반복적으로 모델을 적응시키는 continued pre-training 방법을 제안함.
  4. 이론적 보장: energy-based modeling abstraction에 기반해 OOD flow modeling에 대한 최초의 statistical learning guarantee를 수립하고, generable set expansion을 학습된 표현 공간에서의 local-to-global reachability process로 분석함.
  5. 폭넓은 실증 검증: QM9 소분자, GEOM-Drugs 약물유사분자, therapeutic peptides, protein sequence design 등 네 가지 도메인에서 domain-agnostic OOD 생성 모델링 지표(coverage, diversity)로 평가하여 REC-NF, REC-F 등 기존 recursive synthetic pre-training baseline 대비 유의미한 성능 향상을 입증함(Table 1).

How

Figure 1

Figure 1. (left) Pre-trained flow model µθ0 generates with sufficient probability a set Ωτ

Originality

Limitation & Further Study

Evaluation

Novelty: 5/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 생성 모델링의 근본 패러다임인 distribution matching에서 벗어나 valid design space coverage를 직접 목표로 하는 관점 전환은 매우 신선하며, 이를 뒷받침하는 이론과 다양한 도메인(분자, 펩타이드, 단백질)에서의 실증 결과가 설득력 있게 제시된 우수한 워크숍 논문이다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.92로 Scientific Machine Learning for Dynamics와 Formal Methods and Computational Reasoning가 맞닿아, 'Verifier-Constrained Flow Expansion for Discovery Beyond the Data'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.91로 Scientific Machine Learning for Dynamics와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'SEVerA: Verified Synthesis of Self-Evolving Agents'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.90로 Scientific Machine Learning for Dynamics와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'An AI system to help scientists write expert-level empirical software'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근탐색적 생성 정책을 통한 design space 확장이라는 공통 목표를 가진다.
다른 접근flow/diffusion 모델의 generable set 확장을 위한 다른 탐색 전략을 제시한다.
다른 접근OOD 탐지를 위한 다른 통계적 접근법을 제시한다.
후속 연구valid design space 탐색을 확장하는 후속 연구로 볼 수 있다.
응용 사례OOD discovery 개념을 실제 설계 문제에 응용한 사례이다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드