MOD-SR는 symbolic regression을 multimodal distribution learning과 direct optimization을 통합하는 gradient-guided diffusion model로 재정식화하여, embedding space에서 diffusion 기반 생성과 추론 시점의 gradient guidance를 결합한 프레임워크이다.
Motivation
Known: 기존 generative SR 방법들은 SR을 machine translation 혹은 multimodal task로 취급하는 autoregressive 모델(E2E, MMSR, SNIP)이나 diffusion/VAE 기반 Bayesian 방법(DiffuSR, GenSR)을 사용해왔고, 이와 별도로 GP나 RL 기반 direct optimization 방법(FEX, Sym-Q, DBSR)도 존재한다.
Gap: generative 방법들은 token-level cross-entropy 학습 목표와 fitting error/complexity라는 평가 지표 간의 misalignment로 인해 heuristic 후처리(GP, CMA-ES 등)에 의존하며 생성 과정을 제어할 수 없고, direct optimization 방법은 차원이 커질수록 지수적으로 느려지고 비미분성과 국소 최적해 문제에 시달려, distribution learning과 optimization을 동시에 다루는 통합 모델이 부재하다.
Why: SR은 해석 가능한 수식을 통해 과학적 발견과 물리 법칙 이해, PDE solver 등에 응용되는 근본적인 문제이며, 학습-평가 불일치와 최적화 비효율성을 동시에 해결하는 통합 프레임워크는 SR 연구 전반의 실용성과 확장성을 크게 높일 수 있다.
Approach: MOD-SR는 SR을 p(x0 | D, y*)로 모델링하여, embedding space에서의 gradient-guided diffusion model을 contrastive learning과 representation alignment로 강화하고, 미분 가능한 fixed-depth tree relaxation인 DFEX를 통해 추론 시 gradient guidance가 가능하도록 설계했다.
Achievement
Figure 2. Overview of our method: multimodal encoders pre-trained with contrastive learning condition the diffusion mode
통합 프레임워크 제안: multimodal distribution learning(training)과 direct optimization(inference)을 하나의 diffusion 모델로 통합한 최초의 SR 방법을 제시함.
DFEX 제안: fixed-depth expression tree를 relaxation하여 미분 가능하게 만들어, 추론 시 gradient guidance를 통한 직접 최적화를 가능하게 함.
Representation alignment 도입: 동일 contrastive framework의 symbolic encoder와의 representation alignment를 통해 embedding space의 표현 품질을 향상시킴.
다양한 벤치마크에서 우수한 성능: 여러 SR 벤치마크에서 기존 방법 대비 우수한 성능을 달성했고, 학습된 symbolic embedding space가 기존 방법보다 높은 품질의 표현을 보임을 실험적으로 입증함.
How
Figure 2. Overview of our method: multimodal encoders pre-trained with contrastive learning condition the diffusion mode
수치 데이터를 조건으로 하는 frozen numerical encoder를 이용해 diffusion model을 condition함.
contrastive learning으로 사전 학습된 dual encoder(수치/기호)를 활용하고, 같은 contrastive framework의 symbolic encoder를 이용한 representation alignment(REPA)를 훈련 중 적용함.
DFEX(Differentiable Finite Expression Tree)로 고정 깊이 트리 구조의 discrete operator/variable/coefficient 선택을 relaxation하여 미분 가능하게 만듦.
추론 시 fitting error(및 complexity 등 목표)에 대한 gradient를 diffusion score function에 주입하는 gradient guidance를 적용하여 sampling 과정에서 직접 최적화를 수행함.
Originality
기존에는 distribution learning(multimodal/translation)과 optimization(GP/RL)이 별개 라인으로 분리되어 있었으나, Bayesian 관점에서 이를 gradient-guided diffusion으로 통합한 최초의 시도로 보임.
DFEX라는 새로운 미분 가능한 고정 깊이 트리 relaxation 기법을 제안하여, 기존 DGP나 MetaSymNet과 달리 계수까지 포함해 미분 가능한 최적화를 가능하게 함.
representation alignment를 diffusion 기반 SR에 도입하여 embedding 품질을 향상시킨 점도 새로운 결합임.
Limitation & Further Study
DFEX가 fixed-depth tree로 제한되어 있어, 매우 깊거나 복잡한 표현식 구조를 표현하는 데 한계가 있을 수 있음.
gradient guidance의 강도, random seed 등에 따른 민감도(Figure 4에서 나타난 ablation)로 인해 실제 적용 시 하이퍼파라미터 튜닝 부담이 있을 수 있음.
고차원 변수나 매우 복잡한 실제 데이터셋에 대한 확장성 검증이 발췌된 부분에서는 명확히 드러나지 않아 추가 검증이 필요함.
diffusion 기반 방법 특유의 샘플링 비용(다단계 denoising)에 대한 효율성 분석이 부족해 보임.
총평: SR을 distribution learning과 optimization을 통합하는 관점으로 재정의하고, DFEX와 gradient-guided diffusion을 결합해 학습-평가 불일치 문제를 해결하려는 시도는 참신하고 기술적으로 견고해 보이며, 향후 SR 연구에 중요한 방향을 제시할 것으로 기대된다.
기반 연구SPECTER2 유사도 0.93로 Clinical Time-Series Modeling와 Scientific AI for Physics and Environment가 맞닿아, 'Neural Ordinary Differential Equations'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.