VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models

저자: Wenlong Huang, Chen Wang, Ruohan Zhang, Yunzhu Li, Jiajun Wu, Li Fei-Fei | 날짜: 2023-07-12 | URL: https://arxiv.org/abs/2307.05973 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: arXiv 비독점 라이선스

Essence

Figure 1

Figure 1: VOXPOSER extracts language-conditioned affordances and constraints from LLMs and grounds

LLM의 affordance 추론 능력과 code-writing 능력을 활용하여 3D value map을 생성하고, 이를 model-based planning으로 로봇 trajectory 합성에 활용하는 zero-shot 로봇 조작 방법론.

Motivation

Achievement

Figure 3

Figure 3: Visualization of composed 3D value maps and rollouts in real-world environments. The top row

How

Figure 2

Figure 2: Overview of VOXPOSER. Given the RGB-D observation of the environment and a language in-

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: VoxPoser는 LLM의 높은 수준 추론과 code 생성 능력을 3D 로봇 조작에 처음으로 효과적으로 연결한 혁신적 방법으로, zero-shot 일반화와 실제 로봇 적용 가능성을 보여주는 의미 있는 기여이다. 다만 affordance 정확성, 장기 계획, 계산 효율성 측면의 개선이 필요하다.

같이 보면 좋은 논문

기반 연구1622는 조작과 네비게이션 등 다양한 언어-조작 과제의 대규모 벤치마크를 제공하며, 1457이 제안한 생애주기 학습의 효과를 검증할 실제 평가 환경을 제공한다.
기반 연구Neural Scaling Laws in Robotics 논문은 LLM을 활용한 affordance 추론과 대규모 학습의 가능성에 대한 이론적 논의를 제공해, VoxPoser의 LLM 기반 추론 방법을 뒷받침한다.
기반 연구1622의 VoxPoser는 3D 환경에서의 조작 정책에 도메인 불변 표현을 융합한다는 점에서, DexGraspVLA가 언어-시각-행동 연계 학습을 보강하고 일반화 범위를 넓히는 데 참고가 된다.
기반 연구VoxPoser는 3D 조작을 위한 value map 생성으로, H³DP의 hierarchically conditioned diffusion 정책과 유사하게 고차원 행동 조건화 기법을 보여줍니다.
기반 연구VoxPoser는 3D 환경 상에서 쿼리 가능 value map을 통한 manipulation을 다루며, spatial language map 응용을 실제 로봇 조작 문제로 확대시킵니다.
기반 연구Compose Your Policies!는 LLM을 활용한 plan composition 관점에서 VoxPoser의 code writing 기반 trajectory 합성의 이론적 배경을 제공한다.
다른 접근VoxPoser는 3D voxel을 활용해 조작 정책을 생성하는 방법으로, 1514의 Perceiver-Actor와 유사 구조의 대안이다.
다른 접근VoxPoser: Composable 3D Value Maps for Robotic Manipulation 논문은 3D 공간 표현을 활용한 가치 맵 방식으로 로봇 행동을 계획하므로, 3DSG 기반의 SayPlan과 비슷한 문제에 다른 접근을 제공한다.
다른 접근RoboAgent는 로봇 조작에서 모델 일반화와 효율성 극대화에 초점을 맞추며, VoxPoser의 zero-shot 3D value map 접근과 다른 제너럴리스트 전략을 취한다.
다른 접근RoboPoint는 spatial affordance 프레디션을 활용한 점추적 방식으로 조작 정책을 생성하며, VoxPoser의 3D value map 합성과 다른 접근을 택한다.
다른 접근VoxPoser(1622)는 구성 가능한 3D value map 표현을 로봇 조작에서 활용하여, 공간적 표현 기반 조작 문제(1576)에 대한 또 다른 접근법을 제시한다.
다른 접근CoT-VLA는 LLM의 reasoning·planning 응용 사례로, affordance reasoning·code-writing과 함께 복수 reasoning 방식 비교가 가능하다.
다른 접근VoxPoser는 3D voxel 기반 가치맵으로 로봇 조작을 수행하며, 1517의 PointWorld와 달리 voxel representation을 쓴다.
후속 연구In-Context Imitation Learning via Next-Token Prediction 논문은 VoxPoser의 code-writing 및 visual trace 방식 imitation learning을 scale up 가능한 일반화된 프레임워크로 보여준다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드