CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation

저자: Qixiu Li, Yaobo Liang, Zeyu Wang, Lin Luo, Xi Chen, Mozheng Liao, Fangyun Wei, Yu Deng, Sicheng Xu, Yizhong Zhang, Xiaofan Wang, Bei Liu, Jianlong Fu, Jianmin Bao, Dong Chen, Yuanchun Shi, Jiaolong Yang, Baining Guo | 날짜: 2024-11-29 | URL: https://arxiv.org/abs/2411.19650 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: CC BY

Essence

Figure 1

Figure 1. (a) Success rate (%) comparison of our model against RT-1 [7], RT-1-X [48], RT-2-X [48], Octo [62], and OpenVL

CogACT는 Vision-Language-Model을 기반으로 하되 cognition과 action을 분리하여 specializing된 diffusion action transformer 모듈을 통해 로봇 조작의 성능을 대폭 향상시킨 VLA 모델이다.

Motivation

Achievement

Figure 1

Figure 1. (a) Success rate (%) comparison of our model against RT-1 [7], RT-1-X [48], RT-2-X [48], Octo [62], and OpenVL

How

Figure 2

Figure 2. Overview of our architecture. Our model is componentized into three parts: 1) a vision module encoding informa

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: CogACT는 VLM과 diffusion action transformer의 effective synergy를 통해 로봇 조작 성능에서 significant advancement를 달성한 well-motivated 연구이며, componentized 아키텍처와 체계적인 실험을 통해 높은 원창성과 실용적 가치를 보여준다.

같이 보면 좋은 논문

기반 연구Diffusion Policy 논문은 CogACT에서 사용된 diffusion 기반 행동 생성 모듈의 핵심 이론적 배경을 제공하므로, 두 논문을 함께 읽으면 diffusion action transformer의 역할을 깊게 이해할 수 있습니다.
다른 접근3D Diffusion Policy 논문은 로봇 액션 예측에서 diffusion 기반 정책의 일반화 가능성과 실효성을 강조한다.
다른 접근CogACT 논문은 다양한 로봇 환경에서 시너지적 VLA 정책을 학습함으로써, Octo와는 다른 멀티태스크 범용성을 추구합니다.
다른 접근Diffusion-VLA는 일반izable VLA 정책을 위한 diffusion 기반 접근을 채택하며, CogACT의 cognition-action 분리와 다른 design paradigm을 보여줍니다.
다른 접근CogACT는 plug-in diffusion 없이 일체형 VLA foundation model을 제시함으로써, DexVLA와 범용성·융합 방식에서 차별됩니다.
다른 접근CogACT는 상징적·시각·언어적 프롬프트 통합 기반 스킬 학습을 다루어, cross-embodiment가 아닌 고전 LLM 기반 스킬 학습 방식과의 차이점을 살펴볼 수 있다.
후속 연구HybridVLA 논문은 diffusion과 autoregressive action 예측을 단일 VLA 모델로 결합해 CogACT의 diffusion 기반 액션 토큰 발전 방향을 제시한다.
후속 연구CogACT 논문은 Vision-Language-Action 모델 기반의 시각적 추론 프레임워크를 다루며, Embodied-R의 대규모 VLM과 LM 협력 구조의 학문적 토대를 제공합니다.
후속 연구CogACT 논문은 소형 generalist VLA 설계의 이론적 바탕을 일부 제공하여 NORA와 개념적으로 연결된다.
후속 연구Vision-Language-Action (VLA) Models: Concepts, Progress, Applications 논문은 CogACT를 포함한 최신 VLA 모델들을 종합적으로 비교해 주므로 발전 흐름을 파악하는 데 도움이 됩니다.
후속 연구CogACT의 cognition-action 분리 및 diffusion 기반 토큰 생성 아이디어가 InternVLA-A1의 Mixture-of-Transformers에 반영된다.
응용 사례Compose Your Policies!는 CogACT와 같이 diffusion/flow 기반 정책의 합성과 조합을 실제 로봇 정책 세트에서 성능 개선에 적용합니다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드