RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control

저자: Anthony Brohan, Noah Brown, Justice Carbajal, Yevgen Chebotar, Xi Chen, Krzysztof Choromanski, Tianli Ding, Danny Driess, Avinava Dubey, Chelsea Finn, Pete Florence, Chuyuan Fu, Montse Gonzalez Arenas, Keerthana Gopalakrishnan, Kehang Han, Karol Hausman, Alexander Herzog, Jasmine Hsu, Brian Ichter, Alex Irpan, Nikhil Joshi, Ryan Julian, Dmitry Kalashnikov, Yuheng Kuang, Isabel Leal, Lisa Lee, Tsang-Wei Edward Lee, Sergey Levine, Yao Lu, Henryk Michalewski, Igor Mordatch, Karl Pertsch, Kanishka Rao, Krista Reymann, Michael Ryoo, Grecia Salazar, Pannag Sanketi, Pierre Sermanet, Jaspiar Singh, Anikait Singh, Radu Soricut, Huong Tran, Vincent Vanhoucke, Quan Vuong, Ayzaan Wahid, Stefan Welker, Paul Wohlhart, Jialin Wu, Fei Xia, Ted Xiao, Peng Xu, Sichun Xu, Tianhe Yu, Brianna Zitkovich | 날짜: 2023-07-28 | URL: https://arxiv.org/abs/2307.15818 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: arXiv 비독점 라이선스

Essence

Figure 1

Figure 1 | RT-2 overview: we represent robot actions as another language, which can be cast into text tokens and

인터넷 규모의 데이터로 학습한 vision-language 모델을 로봇 제어에 직접 통합하여 end-to-end 로봇 정책을 학습하는 RT-2 모델을 제안한다. 로봇 액션을 텍스트 토큰으로 표현하여 VLM의 사전학습 이점을 활용하면서도 저수준의 로봇 제어를 가능하게 한다.

Motivation

Achievement

Figure 2

Figure 2 | RT-2 is able to generalize to a variety of real-world situations that require reasoning, symbol

How

Figure 1

Figure 1 | RT-2 overview: we represent robot actions as another language, which can be cast into text tokens and

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: RT-2는 웹 규모 vision-language 모델의 의미론적 지식을 로봇 제어에 직접 통합하는 우아하고 효과적인 방법을 제시하며, 광범위한 실험을 통해 미학습 객체 일반화와 의도한 추론 능력을 입증한다. 로봇 공학에서 대규모 사전학습 활용의 새로운 패러다임을 제안한 것으로 산업적, 학문적 기여도가 크다.

같이 보면 좋은 논문

기반 연구RT-2는 web-scale vision-language-action 지식을 실제 로봇에 적용함으로써, LM-Nav의 multi-modal 대규모 사전학습 기반 내비게이션 아이디어가 실제 조작 응용에도 접목될 수 있음을 보입니다.
기반 연구RT-2는 웹 지식 전이 기반 VLA 모델의 실환경 적용 연구로, LLM 기반 코드-행동 변환의 실 증거를 제공한다.
기반 연구RT-2는 인터넷에서 추출한 데이터까지 다루어 RT-1을 확장함으로써 더 광범위한 작업 및 객체에 대한 일반화 성능을 보여준다.
기반 연구Open-World Object Manipulation using Pre-trained Vision-Language Models 논문은 VLM을 사전 학습 후 조작 과제에 활용하는 실증 연구로, RT-2의 로봇 행동 통합 토대가 됩니다.
기반 연구PaLM-E 논문은 VLM + robot control 융합의 근간 모델로, RT-2의 아키텍처적 기초를 제공한다.
기반 연구RT-2 논문은 RT-X 모델의 후속 연구로, 인터넷 기반 데이터 확장 및 실제 로봇 제어 적용을 심화한다.
기반 연구RT-2 논문은 인터넷 기반 데이터로 RUM의 zero-shot 정책 개념을 확장·일반화한다.
기반 연구RT-2는 대규모 VLM 기반 VLA 모델의 실제 로봇 조작 적용과 실험적 검증을 보여줍니다.
다른 접근RT-2는 다양한 센서와 기기에서의 정보 감지 및 인식에 기초한 VLA 모델 접근법으로, 1587의 센서 하드웨어 기반 방법과 대조됨.
다른 접근RT-2도 vision-language-action 모델을 활용한 실세계 로봇 제어 성능을 검증하므로, OpenVLA와 대형 폐쇄형 모델의 차이와 장단점을 알 수 있다.
다른 접근RT-2(1555)는 대규모 멀티모달 데이터를 활용해 웹 지식을 실제 로봇 제어로 전이시키는 접근법으로, Gemini Robotics와 유사한 목표를 지향한다.
다른 접근RT-2 모델은 VLM과 RL 결합보다 VLM 기반에 집중하며, 인지-실행 간 계층적 브릿지 접근 방식이 다르다.
다른 접근Cross-Platform Scaling 논문은 다양한 embodiment 정책의 확장을 중점적으로 다루며, RT-2의 크로스플랫폼 적용과 비교된다.
후속 연구RT-2 논문은 대규모 로봇 지식 이전과 다중 작업 일반화에서 LIBERO 벤치마크의 핵심 아이디어와 연결됩니다.
후속 연구RT-2는 Vision-Language-Action 모델의 instruction following 및 실행 측면에서 계층적 구조와 매우 관련이 있습니다.
후속 연구RT-2는 VLM의 로봇저수준조작 전이 가능성을 검증해 1466의 벤치마크가 측정하는 문제를 실제 모델로 입증한다.
후속 연구RLRC은 RT-2 처럼 대규모 VLA를 압축, 효율화 적용하는 방법을 제안하여 실배포 및 소형화 적용성을 확장합니다.
반론/비판Foundation Model Driven Robotics 논문은 VLM의 다양한 한계와 도전과제를 다루어 RT-2와 같은 모델의 실제 적용 시 참고할 만한 비판적 시각을 제공한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드