Chain-of-Action: Trajectory Autoregressive Modeling for Robotic Manipulation

저자: Wenbo Zhang, Tianrun Hu, Hanbo Zhang, Yanyuan Qiao, Yuchu Qin, Yang Li, Jiajun Liu, Tao Kong, Lingqiao Liu, Xiao Ma | 날짜: 2025-06-11 | URL: https://arxiv.org/abs/2506.09990 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: arXiv 비독점 라이선스

Essence

Chain-of-Action(CoA)은 역방향 궤적 자동회귀 모델링을 통해 로봇 조작 정책을 학습하는 새로운 시각-운동 정책 패러다임으로, 목표 상태부터 역순으로 행동 시퀀스를 생성하여 누적 오차를 완화한다.

Motivation

Achievement

Figure 4

Figure 4 Success rate improvement on RLBench-60, sorted by improvement from high to low. The average success

How

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: Chain-of-Action은 로봇 조작에서 누적 오차 문제를 근본적으로 해결하기 위해 역순 궤적 생성 패러다임을 도입하며, 필수 설계 요소들의 통합으로 순방향 방식을 명확히 상회하는 성능을 달성하여 시각-운동 정책 학습의 새로운 방향을 제시한다.

같이 보면 좋은 논문

다른 접근Deep RL for Bipedal Locomotion은 조작이 아닌 모바일 로봇에 적용한 Deep RL 사례를 다루며, 적용영역의 차별점을 보여줍니다.
다른 접근Deep Reinforcement Learning for Bipedal Locomotion 논문은 world model 기반은 아니지만 실제 보행 제어 과제에서 대안적 강화학습 접근을 제공합니다.
다른 접근Human2Robot은 사람의 행동 궤적 기반 imitation learning을 활용한 정책 학습으로, 역방향 자동회귀인 Chain-of-Action과 상반되는 시퀀스 생성 패러다임을 보여줍니다.
후속 연구Chain-of-Action은 시퀀스 예측 기반 로봇 imitation learning 프레임워크로, BeT의 multi-modal cloning 아이디어의 주요 이론적 기반이 된다.
후속 연구Deep Reinforcement Learning for Bipedal Locomotion 은 실제 이족 보행 로봇의 RL 적용에 대한 이론과 문제점을 다뤄, 1526의 실험적 결과에 기초적 인사이트를 제공한다.
후속 연구Diffusion Transformer Policy는 자동회귀 기반 행동 시퀀스 생성에서 diffusion 방식의 정책 학습으로 확장된 사례입니다.
후속 연구Chain-of-Action 논문은 trajectory autoregressive modeling 방식의 기초 이론을 제공하여, Diffusion-VLA의 reasoning-injected autoregressive 구조와 연결점이 많습니다.
후속 연구Deep Reinforcement Learning for Bipedal Locomotion 논문은 나VILA의 RL locomotion policy 부분의 이론적 기초를 제공한다.
후속 연구1328은 2족 보행과 같은 로봇의 동적 운동에서 심층강화학습을 다루며, 1431이 제안하는 마찰 aware Sim2Real 연구의 기초 물리 모델 논의에 기반을 제공한다.
후속 연구Chain-of-Action 논문은 sequence modeling 기반 action decoding에 핵심 아키텍처적 통찰을 제공해, Discrete Diffusion VLA의 구조적 설계 배경이 됩니다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드