Gemini Robotics 1.5: Pushing the Frontier of Generalist Robots with Advanced Embodied Reasoning, Thinking, and Motion Transfer

저자: Gemini Robotics Team, Abbas Abdolmaleki, Saminda Abeyruwan, Joshua Ainslie, Jean-Baptiste Alayrac, Montserrat Gonzalez Arenas, Ashwin Balakrishna, Nathan Batchelor, Alex Bewley, Jeff Bingham, Michael Bloesch, Konstantinos Bousmalis, Philemon Brakel, Anthony Brohan, Thomas Buschmann, Arunkumar Byravan, Serkan Cabi, Ken Caluwaerts, Federico Casarini, Christine Chan, Oscar Chang, London Chappellet-Volpini, Jose Enrique Chen, Xi Chen, Hao-Tien Lewis Chiang, Krzysztof Choromanski, Adrian Collister, David B. D'Ambrosio, Sudeep Dasari, Todor Davchev, Meet Kirankumar Dave, Coline Devin, Norman Di Palo, Tianli Ding, Carl Doersch, Adil Dostmohamed, Yilun Du, Debidatta Dwibedi, Sathish Thoppay Egambaram, Michael Elabd, Tom Erez, Xiaolin Fang, Claudio Fantacci, Cody Fong, Erik Frey, Chuyuan Fu, Ruiqi Gao, Marissa Giustina, Keerthana Gopalakrishnan, Laura Graesser, Oliver Groth, Agrim Gupta, Roland Hafner, Steven Hansen, Leonard Hasenclever, Sam Haves, Nicolas Heess, Brandon Hernaez, Alex Hofer, Jasmine Hsu, Lu Huang, Sandy H. Huang, Atil Iscen, Mithun George Jacob, Deepali Jain, Sally Jesmonth, Abhishek Jindal, Ryan Julian, Dmitry Kalashnikov, M. Emre Karagozler, Stefani Karp, Matija Kecman, J. Chase Kew, Donnie Kim, Frank Kim, Junkyung Kim, Thomas Kipf, Sean Kirmani, Ksenia Konyushkova, Li Yang Ku, Yuheng Kuang, Thomas Lampe, Antoine Laurens, Tuan Anh Le, Isabel Leal, Alex X. Lee, Tsang-Wei Edward Lee, Guy Lever, Jacky Liang, Li-Heng Lin, Fangchen Liu, Shangbang Long, Caden Lu, Sharath Maddineni, Anirudha Majumdar, Kevis-Kokitsi Maninis, Andrew Marmon, Sergio Martinez, Assaf Hurwitz Michaely, Niko Milonopoulos, Joss Moore, Robert Moreno, Michael Neunert, Francesco Nori, Joy Ortiz, Kenneth Oslund, Carolina Parada, Emilio Parisotto, Amaris Paryag, Acorn Pooley, Thomas Power, Alessio Quaglino, Haroon Qureshi, Rajkumar Vasudeva Raju, Helen Ran, Dushyant Rao, Kanishka Rao, Isaac Reid, David Rendleman, Krista Reymann, Miguel Rivas, Francesco Romano, Yulia Rubanova, Peter Pastor Sampedro, Pannag R Sanketi, Dhruv Shah, Mohit Sharma, Kathryn Shea, Mohit Shridhar, Charles Shu, Vikas Sindhwani, Sumeet Singh, Radu Soricut, Rachel Sterneck, Ian Storz, Razvan Surdulescu, Jie Tan, Jonathan Tompson, Saran Tunyasuvunakool, Jake Varley, Grace Vesom, Giulia Vezzani, Maria Bauza Villalonga, Oriol Vinyals, René Wagner, Ayzaan Wahid, Stefan Welker, Paul Wohlhart, Chengda Wu, Markus Wulfmeier, Fei Xia, Ted Xiao, Annie Xie, Jinyu Xie, Peng Xu, Sichun Xu, Ying Xu, Zhuo Xu, Jimmy Yan, Sherry Yang, Skye Yang, Yuxiang Yang, Hiu Hong Yu, Wenhao Yu, Wentao Yuan, Yuan Yuan, Jingwei Zhang, Tingnan Zhang, Zhiyuan Zhang, Allan Zhou, Guangyao Zhou, Yuxiang Zhou | 날짜: 2025-10-02 | URL: https://arxiv.org/abs/2510.03342 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: CC BY

Essence

Figure 1

Figure 1 | The Gemini Robotics 1.5 family of models consists of Gemini Robotics 1.5, a VLA, and Gemini

Gemini Robotics 1.5는 Motion Transfer 메커니즘과 embodied thinking 능력을 통해 다중 로봇 플랫폼을 제어할 수 있는 Vision-Language-Action 모델이며, Gemini Robotics-ER 1.5는 embodied reasoning에서 최첨단 성능을 달성하는 Vision-Language 모델이다.

Motivation

Achievement

Figure 1

Figure 1 | The Gemini Robotics 1.5 family of models consists of Gemini Robotics 1.5, a VLA, and Gemini

How

Figure 1

Figure 1 | The Gemini Robotics 1.5 family of models consists of Gemini Robotics 1.5, a VLA, and Gemini

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 4/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: Gemini Robotics 1.5는 Motion Transfer, Thinking VLA, embodied reasoning의 세 가지 핵심 혁신을 통해 범용 로봇의 일반화 능력과 추론 능력을 크게 향상시켰으며, multi-embodiment 제어와 zero-shot skill transfer라는 실질적 성과로 로봇 AI의 새로운 경계를 제시한다.

같이 보면 좋은 논문

기반 연구Perceiver-Actor는 멀티태스킹 트랜스포머 구조의 멀티로봇 조작 정책을 제안하여, Gemini Robotics 1.5의 embodied thinking과 전사적 조작 제어 기초 연구로 연결됩니다.
기반 연구Gemini Robotics 1.5는 실제 로봇 플랫폼을 대상으로 한 generalist 벤치마킹을 제공함으로써, RoboTwin의 시뮬레이션 및 벤치마크 결과가 실제에 어떻게 적용될 수 있는지 보여준다.
기반 연구Gemini Robotics 1.5는 고충실도 시뮬레이션 및 실제 환경에서의 범용 조작을 실현하며, 1523의 시뮬레이션-실 로봇 적용관심과 맞닿아 있다.
기반 연구Gemini Robotics (초기 버전)은 모션 트랜스퍼 및 embodied thinking 등 1.5 버전의 핵심 요소들의 토대를 마련한 선행 연구입니다.
기반 연구Gemini Robotics 1.5는 현실적 시각+정확한 물리 기반의 로봇 시뮬레이션 및 장기과제 대응을 모색하여, MuBlE의 실험환경을 더 확장 발전시킨 사례입니다.
기반 연구Unified Vision-Language-Action Model 논문은 다양한 로봇 플랫폼을 대상으로 통합 VLA 모델을 제안하여 Gemini Robotics 1.5의 generalist 로봇 목표에 기반을 제공합니다.
기반 연구Gemini Robotics 1.5는 다중 embodied 플랫폼을 지원하며, 미세 조정 가능한 공유 표현 및 협동 제어 프레임워크측면에서 GauDP의 다중 에이전트 협업을 실질적으로 확장합니다.
다른 접근Gemini Robotics 1.5 논문은 데스크톱 환경을 넘어서 실제 다양한 로봇 플랫폼으로 vision-action 사전학습 지식 전이 방법을 확장한다.
다른 접근WholeBodyVLA는 여러 로봇에서 whole-body 제어를 위한 통합 VLA 표현 모델을 제안하여, Gemini Robotics 1.5의 다양한 플랫폼 대응과 유사 주제를 다룹니다.
다른 접근A Pragmatic VLA Foundation Model은 Gemini Robotics 1.5와 같이 범용 로봇 제어를 목표로 하면서, motion transfer 대신 실제 환경에 적응하는 실용적 정책 학습을 강조합니다.
후속 연구Gemini Robotics 1.5 논문은 멀티모달 대형 모델을 활용한 다양한 실제 로봇 탐색·제어 실험을 제공하여, ForesightNav의 scene imagination 기반 탐색에 적용할 수 있는 실제 사례가 됩니다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드