RoboArena: Distributed Real-World Evaluation of Generalist Robot Policies

저자: Pranav Atreya, Karl Pertsch, Tony Lee, Moo Jin Kim, Arhan Jain, Artur Kuramshin, Clemens Eppner, Cyrus Neary, Edward Hu, Fabio Ramos, Jonathan Tremblay, Kanav Arora, Kirsty Ellis, Luca Macesanu, Marcel Torne Villasevil, Matthew Leonard, Meedeum Cho, Ozgur Aslan, Shivin Dass, Jie Wang, William Reger, Xingfang Yuan, Xuning Yang, Abhishek Gupta, Dinesh Jayaraman, Glen Berseth, Kostas Daniilidis, Roberto Martin-Martin, Youngwoon Lee, Percy Liang, Chelsea Finn, Sergey Levine | 날짜: 2025-06-22 | URL: https://arxiv.org/abs/2506.18123 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: arXiv 비독점 라이선스

Essence

Figure 1

Figure 1: We present RoboArena, a distributed real-world evaluation framework for generalist robot

RoboArena는 분산된 평가자 네트워크를 통해 실제 환경에서 일반화된 로봇 정책을 pairwise 비교하고 집계하여 정책 순위를 도출하는 크라우드소싱 기반 평가 프레임워크이다. 600회 이상의 실제 로봇 평가를 통해 중앙 집중식 평가보다 정확한 정책 순위를 제공함을 입증했다.

Motivation

Achievement

Figure 1

Figure 1: We present RoboArena, a distributed real-world evaluation framework for generalist robot

How

Figure 2

Figure 2: Pipeline for extracting qualitative policy characteristics from RoboArena’s rich evaluation

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: RoboArena는 일반화 로봇 정책의 평가라는 중요한 문제에 대해 혁신적인 분산 크라우드소싱 접근법을 제시하며, 600회의 실제 로봇 평가를 통해 방법의 효과성을 입증했다. 오픈 커뮤니티 플랫폼으로서 로봇 정책 벤치마킹 생태계에 상당한 기여를 할 수 있는 획기적인 연구이다.

같이 보면 좋은 논문

기반 연구RoboArena는 다양한 현실 환경에서 generalist 로봇 정책 평가 프레임워크를 제공하여 Pri-GP와 같은 분산 협력 학습 알고리즘의 실제 평가에 적용될 수 있다.
기반 연구1535의 RoboArena는 DROID와 같이 다수 플랫폼과 여러 실제 환경에서 정책 평가를 지원하는 대규모 벤치마크 구축 사례로 후보 정책의 일반화 평가를 확장한다.
기반 연구Evaluating Real-World Robot Manipulation Policies in Simulation 논문은 실세계 정책 평가 방법론과 실제 평가 지표 개발에 있어 RoboArena의 기술적 배경을 제공한다.
기반 연구로보틱스에서 RL, evaluation, 그리고 실제 환경 적용까지의 이론적 서베이를 제공하여 실세계 분산 평가의 의의와 한계를 분석합니다.
기반 연구RoboArena는 다양한 정책의 실제 로봇 분산 평가를 다루며, DeeR-VLA의 효율적 모델 적용 시 실제 효과를 검증하는 실제 사례로 볼 수 있습니다.
기반 연구RoboArena는 실제 로봇 환경에서 다양한 정책을 병렬로 평가하기 위해 설계된 벤치마크로, 여러 정책의 조합 성능을 분석하는 Compose Your Policies 논문의 실험적 응용사례가 될 수 있습니다.
다른 접근VR-Robo처럼 실제 환경에서의 평가 및 실험에 집중하지만, RoboArena는 다중 로봇에 대한 분산 평가에 초점을 두어 환경 구성과 검증 방식이 다르다.
다른 접근AutoEval 논문은 중앙집중적 평가와 자동화된 벤치마크 방식으로, crowd 기반 RoboArena와 평가 프레임워크가 대조된다.
후속 연구RoboMIND는 멀티-엠보디먼트 정책 평가 체계로 RoboArena의 실제 평가 데이터를 더 정량적으로 활용한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드