저자: Austin Stone, Ted Xiao, Yao Lu, Keerthana Gopalakrishnan, Kuang-Huei Lee, Quan Vuong, Paul Wohlhart, Sean Kirmani, Brianna Zitkovich, Fei Xia, Chelsea Finn, Karol Hausman | 날짜: 2023-03-02 | URL: https://arxiv.org/abs/2303.00905 📄 PDF
Essence
Figure 1: Overview of MOO. We train a language-conditioned policy conditioned on object locations from a
Pre-trained vision-language model(VLM)을 로봇 정책과 인터페이싱하여 로봇이 직접 경험하지 못한 새로운 물체 카테고리에 대한 지시를 따를 수 있도록 하는 MOO(Manipulation of Open-World Objects) 방법을 제안한다.
Evaluation
Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5
총평: 본 논문은 pre-trained VLM을 로봇 조작에 실질적으로 통합하여 의미론적 일반화를 달성한 중요한 기여이며, 실제 로봇 실험과 다중 모달리티 확장을 통해 실용성을 입증했다.
같이 보면 좋은 논문
기반 연구CLIPort 논문은 pre-trained vision-language 모델 기반 조작 정책의 개발 및 전이 실험에서 핵심 방법론적 기반을 제공한다.
기반 연구Open-World Object Manipulation 논문은 X-Embodiment 데이터셋의 활용과 오픈월드 객체 조작에 대한 실질 적용 사례를 보인다.
기반 연구Open-World Object Manipulation는 pre-trained VLA 기반 자동 조작 시연 생성을 로봇 실세계 환경에 적용해 Manipulate-Anything의 실질적 응용을 보여준다.
다른 접근Manipulate-Anything은 VLM 기반 generalist 로봇 조작을 실제 세계에 적용하며, MOO 방식의 대안적 접근을 제시한다.
기반 연구Open-World Object Manipulation은 대규모 VLA와 벤치마크를 통한 실제 오브젝트 조작 사례로, EMLM(VLM+LLM+Action)의 미래지향적 응용 방향을 보여줍니다.
다른 접근Open-World Object Manipulation using Pre-trained Vision-Language Models는 사전학습된 VLM의 툴 사용 능력을 조작 태스크에 적용하며, ManipVQA와 시너지 및 비교점이 많습니다.
다른 접근Robotic Control via Embodied Chain-of-Thought Reasoning 논문은 체인적 rasoning과 policy linkage를 강조하여, MOO와 다른 지시 처리 방법을 비교할 수 있습니다.
다른 접근Open-World Object Manipulation using Pre-trained Vision-Language Models는 생성형 모델 대신 VLM 기반 전략으로 조작의 다중 모드/장기 계획 문제에 접근합니다.
후속 연구Open-World Object Manipulation using Pre-trained Vision-Language Models 논문은 VLM을 사전 학습 후 조작 과제에 활용하는 실증 연구로, RT-2의 로봇 행동 통합 토대가 됩니다.
후속 연구FLaRe는 대량의 행동 시연/로봇 데이터를 활용한 대규모 학습을 통해 open-world object manipulation에 더욱 강인한 policy를 제안한다.