Reinforcement Learning with Discrete Diffusion Policies for Combinatorial Action Spaces

저자: Haitong Ma, Ofir Nabati, Aviv Rosenberg, Bo Dai, Oran Lang, Craig Boutilier, Na Li, Shie Mannor, Lior Shani, Guy Tennenholtz | 날짜: 2026 | URL: https://openreview.net/forum?id=tbz8ixrEKd 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 2

policy mirror descent (PMD)로 정의된 안정적 목표 정책 분포를 discrete diffusion model이 distributional matching 방식으로 모방하도록 학습시켜, 거대한 combinatorial action space에서도 안정적이고 샘플 효율적인 policy improvement가 가능한 RL 프레임워크(RL-D2)를 제안한다.

Motivation

Achievement

Figure 3
  1. RL-D2 프레임워크 제안: PMD 기반 target distribution을 이용해 policy update를 distributional matching 문제로 재구성함으로써, RL objective 최적화와 representation learning(diffusion model)을 분리해 학습을 안정화하는 새로운 online 학습 프레임워크를 제시했다.
  2. FKL/RKL 두 가지 policy improvement 방법 도출: forward KL과 reverse KL 최소화에 기반한 두 실용적 학습 방식을 유도하고 분석하여, FKL은 뛰어난 sample efficiency와 빠른 초기 수렴을, RKL은 안정적 학습과 높은 asymptotic 성능을 제공한다는 trade-off를 규명했다.
  3. 다양한 challenging 도메인에서 state-of-the-art 달성: DNA sequence generation, Atari에서의 macro-action RL, Google Research Football의 cooperative multi-agent RL 등 세 가지 이질적 도메인에서 baseline 대비 동등하거나 우수한 성능과 뛰어난 sample efficiency를 입증했다.

How

Figure 4

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: PMD 기반 distributional matching이라는 명확한 이론적 근거를 바탕으로 discrete diffusion policy를 online RL에 안정적으로 통합한 참신하고 실용적인 기여이며, 다양한 combinatorial 벤치마크에서 우수한 성능을 입증한 점이 인상적이다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.93로 Reinforcement Learning Policy Optimization와 Molecular Simulation and Generative Modeling가 맞닿아, 'Derivative-Free Guidance in Continuous and Discrete Diffusion Models with Soft Value-Based Decoding'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구policy mirror descent의 이론적 기반을 제공하는 연구로 판단된다.
기반 연구SPECTER2 유사도 0.92로 Reinforcement Learning Policy Optimization와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'MLGym: A new framework and benchmark for advancing ai research agents'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구cardinality-invariant policy 개념을 확장하여 적용한 연구
기반 연구단백질 서열 설계에 BoN 기반 최적화를 적용한 유사 사례이다.
다른 접근combinatorial action space에서의 정책 학습에 대한 다른 접근법을 제시하는 연구로 보인다.
다른 접근rich feedback을 활용하는 DistIL과 달리 policy mirror descent 기반 diffusion 모방을 제시하는 밀접한 대안 연구
다른 접근stochastic GFlowNet 안정화를 위한 다른 접근 방식 제시
다른 접근physics-based motion imitation 평가에서 다른 지표 접근을 취한다.
다른 접근distributional matching을 통한 안정적 정책 학습이라는 핵심 방법론을 공유한다.
다른 접근Hilbert space 상의 확산 기반 샘플링에 대한 대안적 방법론을 제시한다.
다른 접근policy gradient 기반 discrete latent 학습이라는 방법론적 기반을 공유한다.
후속 연구discrete flow matching 기반 그래프 생성 모델의 이론적 토대를 제공한다.
후속 연구RLVR에서의 exploration 문제와 policy 다양성에 대한 이론적 기반을 제공한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드