Open-World Object Manipulation using Pre-trained Vision-Language Models

저자: Austin Stone, Ted Xiao, Yao Lu, Keerthana Gopalakrishnan, Kuang-Huei Lee, Quan Vuong, Paul Wohlhart, Sean Kirmani, Brianna Zitkovich, Fei Xia, Chelsea Finn, Karol Hausman | 날짜: 2023-03-02 | URL: https://arxiv.org/abs/2303.00905 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: arXiv 비독점 라이선스

Essence

Figure 1

Figure 1: Overview of MOO. We train a language-conditioned policy conditioned on object locations from a

Pre-trained vision-language model(VLM)을 로봇 정책과 인터페이싱하여 로봇이 직접 경험하지 못한 새로운 물체 카테고리에 대한 지시를 따를 수 있도록 하는 MOO(Manipulation of Open-World Objects) 방법을 제안한다.

Motivation

Achievement

Figure 5

Figure 5: Main Results. While baseline methods perform competitively on in-distribution combinations of

How

Figure 2

Figure 2: MOO architecture: We extract object location (represented as the center of the bounding box) on

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: 본 논문은 pre-trained VLM을 로봇 조작에 실질적으로 통합하여 의미론적 일반화를 달성한 중요한 기여이며, 실제 로봇 실험과 다중 모달리티 확장을 통해 실용성을 입증했다.

같이 보면 좋은 논문

기반 연구CLIPort 논문은 pre-trained vision-language 모델 기반 조작 정책의 개발 및 전이 실험에서 핵심 방법론적 기반을 제공한다.
기반 연구Open-World Object Manipulation 논문은 X-Embodiment 데이터셋의 활용과 오픈월드 객체 조작에 대한 실질 적용 사례를 보인다.
기반 연구Open-World Object Manipulation는 pre-trained VLA 기반 자동 조작 시연 생성을 로봇 실세계 환경에 적용해 Manipulate-Anything의 실질적 응용을 보여준다.
다른 접근Manipulate-Anything은 VLM 기반 generalist 로봇 조작을 실제 세계에 적용하며, MOO 방식의 대안적 접근을 제시한다.
기반 연구Open-World Object Manipulation은 대규모 VLA와 벤치마크를 통한 실제 오브젝트 조작 사례로, EMLM(VLM+LLM+Action)의 미래지향적 응용 방향을 보여줍니다.
다른 접근Open-World Object Manipulation using Pre-trained Vision-Language Models는 사전학습된 VLM의 툴 사용 능력을 조작 태스크에 적용하며, ManipVQA와 시너지 및 비교점이 많습니다.
다른 접근Robotic Control via Embodied Chain-of-Thought Reasoning 논문은 체인적 rasoning과 policy linkage를 강조하여, MOO와 다른 지시 처리 방법을 비교할 수 있습니다.
다른 접근Open-World Object Manipulation using Pre-trained Vision-Language Models는 생성형 모델 대신 VLM 기반 전략으로 조작의 다중 모드/장기 계획 문제에 접근합니다.
후속 연구Open-World Object Manipulation using Pre-trained Vision-Language Models 논문은 VLM을 사전 학습 후 조작 과제에 활용하는 실증 연구로, RT-2의 로봇 행동 통합 토대가 됩니다.
후속 연구FLaRe는 대량의 행동 시연/로봇 데이터를 활용한 대규모 학습을 통해 open-world object manipulation에 더욱 강인한 policy를 제안한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드