저자: Philipp Höllmer, Stefano Martiniani | 날짜: 2026 | URL: https://openreview.net/forum?id=xfHppnGXaH 📄 PDF
라이선스: OpenReview 공개(오픈액세스)
Figure 1. Inference-time RL for CSP in velocity-based OMatG-IRL. (a) The deterministic base ODE with pretrained velocity
본 논문은 flow-matching 기반 생성모델의 velocity field에 직접 policy-gradient RL을 적용하여 score 계산 없이도 결정 구조 예측(CSP)에 강화학습을 적용할 수 있는 OMatG-IRL 프레임워크를 제안한다. 이를 통해 에너지 기반 목적함수를 강화하면서도 조성(composition) 조건화를 통해 다양성을 유지하고, velocity-annealing 스케줄 학습으로 샘플링 효율을 크게 향상시킨다.
Figure 4. Test-set evaluation metrics for velocity-annealing OMatG
Figure 1. Inference-time RL for CSP in velocity-based OMatG-IRL. (a) The deterministic base ODE with pretrained velocity
총평: Flow-matching 기반 생성모델에 score 계산 없이 policy-gradient RL을 적용 가능케 한 방법론적 기여가 뚜렷하며, CSP task에 대한 RL 최초 적용과 velocity-annealing을 통한 샘플링 효율 개선이라는 실용적 성과도 인상적이다. 다만 실험 범위가 제한적이어서 다양한 물성 및 데이터셋에 대한 일반화 검증이 후속 연구로 필요하다.