저자: Haoyu Zhen, Xiaowen Qiu, Peihao Chen, Jincheng Yang, Xin Yan, Yilun Du, Yining Hong, Chuang Gan | 날짜: 2024-03-14 | URL: https://arxiv.org/abs/2403.09631 📄 PDF
Essence
Figure 2. Overview of our 3D-VLA pipeline. The left part shows our goal-generation capability. Our model can imagine the
3D-VLA는 3D 인식, 추론, 행동을 생성형 월드 모델로 통합하는 embodied foundation model이며, 3D LLM 위에 interaction token과 diffusion model을 결합하여 로봇의 목표 이미지/포인트 클라우드 생성과 행동 예측을 수행한다.
Evaluation
Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5
총평: 3D-VLA는 embodied AI의 새로운 패러다임을 제시하며, 3D 인식과 월드 모델 기반 행동 생성을 통합한 점에서 혁신적이다. 대규모 3D embodied 데이터셋 구축과 multimodal goal generation 능력은 로봇 조작 분야에 상당한 기여를 할 수 있으나, 실제 로봇 환경에서의 검증이 필요하다.
같이 보면 좋은 논문
기반 연구World Models 논문은 3D-VLA와 같이 내적 월드 모델의 설계 및 적용에 대한 이론적/방법론적 배경을 제공한다.
기반 연구Genie는 생성형 상호작용 환경 구축 기술을 제시하여 3D-VLA의 월드 모델링 및 행동 생성 전략의 기초가 된다.
기반 연구3D-VLA는 3D 시각 표현과 diffusion 기법을 결합한 월드 모델로, DP3의 점군 기반 diffusion 정책 아이디어를 발전시킨다.
다른 접근3D Diffusion Policy는 3D 환경에서 diffusion 기반 정책 학습을 다르게 구현한 사례로 두 모델의 접근법을 비교할 수 있다.
다른 접근3D-VLA: A 3D Vision-Language-Action Generative World Model은 3D 객체 조작에서 멀티모달 생성적 모델을 활용하여 RVT와 유사 도메인 내 다른 방법론을 제시한다.
다른 접근3D-VLA는 3D vision-language-action 통합 foundation model로, LEO와 3D 환경 내 embodied generalist agent 접근법의 실질적 차이를 살펴볼 수 있다.
다른 접근DexVLA는 diffusion expert를 활용한 행동 생성으로 3D-VLA의 diffusion 기반 3D 행동 생성과 대비점이 있다.
다른 접근3D-VLA는 3D equivariance와 VLA 모델을 통합한 생성적 모델로, 동형성 기반 정책 학습 구조에서 다른 방법론을 제시한다.
다른 접근VeBrain의 2D 시각 공간 프레임워크와는 달리 3D-VLA는 3D 세계 모델을 통한 시각-언어-행동 통합을 시도하므로 다양한 공간적 접근법 비교가 가능하다.
다른 접근3D-VLA 논문은 3D world modeling과 멀티에이전트 환경을 위한 VLA 생성을 워드모델 방향에서 다루어, GauDP의 Gaussian field 표현과 기저 아이디어가 유사하나 방법론에 차이가 있습니다.
후속 연구3D-VLA는 3D 환경에서 multimodal world modeling을 통해
1452의 universal simulator 발상에 이론적 기반을 제공한다.
후속 연구Diffusion-VLA는 3D-VLA에서 사용된 diffusion 기반 행동/비주얼 생성 전략의 범용화와 다양한 적용을 탐구한다.
후속 연구3D-VLA 논문은 다양한 하드웨어/플랫폼에서의 VLA 성능 평가 아키텍처를 제공한다.
후속 연구3D-VLA는 3D 장면에서 VLA를 수행하는 생성적 월드 모델로서, PointWorld의 3D모델링 확장 기반이 됩니다.