Diffusion-State Policy Optimization for Masked Diffusion Language Models

저자: Daisuke Oba, Hiroki Furuta, Naoaki Okazaki | 날짜: 2026 | URL: https://openreview.net/forum?id=wA311n42ck 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: OpenReview 공개(오픈액세스)

Essence

Figure 1

Figure 1. Conceptual overview. Top: Terminal-feedback PO

masked diffusion language model(MDLM)의 policy optimization에서 최종 completion에만 주어지는 terminal reward는 중간 마스크 채우기 결정들에 대해 조악한 credit assignment만 제공한다는 문제를 지적하고, rollout 중 이미 생성된 중간 상태(intermediate masked state)의 logits를 재사용해 same-state branching으로 세밀한 credit assignment를 수행하는 plug-in objective인 Diffusion-State Policy Optimization(DiSPO)을 제안한다.

Motivation

Achievement

Figure 4

Figure 4. Wall-clock-matched training curves on LLaDA-8B-

DiSPO는 LLaDA-8B-Instruct 모델에서 diffu-GRPO와 SPG라는 두 terminal-feedback MDLM PO 방법에 plug-in으로 결합되었을 때, 동일한 rollout 연산량과 optimizer step 수 조건 하에서 GSM8K, MATH500 등의 수학 추론 벤치마크와 Sudoku, Countdown 등의 symbolic planning 벤치마크에서 baseline 대비 일관된 성능 향상을 보였다.

How

Figure 3

Figure 3. Variance reduction of the step-wise gradients on

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: MDLM policy optimization에서 rollout 중 자연스럽게 생성되는 중간 상태 정보를 추가 비용 없이 재활용해 credit assignment를 개선한다는 아이디어가 이론적으로 잘 뒷받침되고 실험적으로도 일관된 개선을 보여주는 실용적이고 견고한 plug-in 기법이다.

같이 보면 좋은 논문

기반 연구SPECTER2 유사도 0.92로 Reinforcement Learning Policy Optimization와 Scientific Information Extraction and QA가 맞닿아, 'Deepseek-v3 technical report'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.93로 Reinforcement Learning Policy Optimization와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'BiasFilter: An inference-time debiasing framework for large language models'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
다른 접근LLM 편향 완화를 위한 다른 추론 시간 개입 기법 제안
기반 연구SPECTER2 유사도 0.91로 Reinforcement Learning Policy Optimization와 LLM Benchmarking and Agent Evaluation가 맞닿아, 'Curriculum Reinforcement Learning from Easy to Hard Tasks Improves LLM Reasoning'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구SPECTER2 유사도 0.91로 Reinforcement Learning Policy Optimization와 LLMs for Scholarly Communication가 맞닿아, 'Sci2Pol: Evaluating and Fine-tuning LLMs on Scientific-to-Policy Brief Generation'가 이 ICML 2026 논문의 배경·대안·응용 맥락을 보완한다.
기반 연구masked diffusion 모델의 강화학습 최적화 기반을 제공한다.
기반 연구MDLM 정책 최적화의 이론적 기반을 제공한다.
후속 연구terminal reward 문제를 확장하여 다룬다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드