Compose Your Policies! Improving Diffusion-based or Flow-based Robot Policies via Test-time Distribution-level Composition

저자: Jiahang Cao, Yize Huang, Hanzhong Guo, Rui Zhang, Mu Nan, Weijian Mai, Jiaxu Wang, Hao Cheng, Jingkai Sun, Gang Han, Wen Zhao, Qiang Zhang, Yijie Guo, Qihao Zheng, Chunfeng Song, Xiao Li, Ping Luo, Andrew F. Luo | 날짜: 2025-10-01 | URL: https://arxiv.org/abs/2510.01068 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: arXiv 비독점 라이선스

Essence

본 논문은 General Policy Composition (GPC)를 제안하여 사전학습된 diffusion 또는 flow 기반 로봇 정책들의 분포 수준 점수를 convex 조합으로 결합함으로써, 추가 학습 없이 개별 정책보다 우수한 성능을 달성한다.

Motivation

Achievement

How

Figure 2

Figure 2: Overview of our proposed General Policy Composition. Combining distributional

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 본 논문은 기존 정책 활용을 통한 성능 향상이라는 실용적 문제를 이론적 기초와 함께 해결하며, GPC는 간단하면서도 효과적인 방법으로 로봇 학습의 데이터 효율성 문제에 대한 새로운 관점을 제시한다. 광범위한 실험 검증과 우수한 성능 향상은 로봇 제어 분야에 상당한 기여를 한다.

같이 보면 좋은 논문

기반 연구Compose Your Policies!는 CogACT와 같이 diffusion/flow 기반 정책의 합성과 조합을 실제 로봇 정책 세트에서 성능 개선에 적용합니다.
기반 연구FlowPolicy(1337)는 1613의 flow-matching 기반 행동 생성 아이디어를 다양한 환경에 확장한 사례로, 정책 효율성과 일반화 성능을 비교할 수 있다.
다른 접근Compose Your Policies는 diffusion/flow/trajectory 모델 정책 융합을 통해 동작 다양성과 성능을 끌어올리는 방안을 실험하므로, Diffusion Policy의 한계 극복의 새로운 접근법입니다.
다른 접근Diffusion이나 flow 방식이 아닌 mixture-of-expert 기반으로 diffusion/flow를 효율적으로 학습하는 사례이므로 실제 정책 학습 구조 비교가 가능합니다.
다른 접근Compose Your Policies는 diffusion/flow 모델의 혼합을 통한 정책 효율화라는 유사 과제를 다른 구조적 접근으로 해결합니다.
다른 접근HybridVLA는 diffusion과 autoregression을 결합하여 정책을 생성하므로, 복수 정책 조합의 또 다른 방식을 제안한다.
후속 연구Compose Your Policies!는 LLM을 활용한 plan composition 관점에서 VoxPoser의 code writing 기반 trajectory 합성의 이론적 배경을 제공한다.
후속 연구Compose Your Policies! 논문은 다양한 정책 모듈을 결합/선택하는 아키텍처로, MoLe-VLA의 Mixture-of-Layers 접근에 사상적으로 연결됩니다.
후속 연구Real-Time Execution of Action Chunking Flow Policies의 아이디어는 Compose Your Policies! 논문의 diffusion/flow 기반 정책 조합에 관한 이론을 근간으로 한다.
후속 연구DiWA는 world models를 활용해 diffusion policy adaptation을 구현하며, Compose Your Policies!의 policy composition 개념을 더 세밀하게 확장합니다.
후속 연구ManiFlow는 consistency distillation 기반의 정책 조합을 다루며, GPC가 diffusion 정책 결합을 실제 어떻게 성능 개선하는지 연구를 확장할 수 있다.
응용 사례VLA-RL은 diffusion 혹은 flow-based policy를 실세계를 위한 general manipulation policy로 실질적으로 적용한 사례입니다.
응용 사례RoboArena는 실제 로봇 환경에서 다양한 정책을 병렬로 평가하기 위해 설계된 벤치마크로, 여러 정책의 조합 성능을 분석하는 Compose Your Policies 논문의 실험적 응용사례가 될 수 있습니다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드