VLABench: A Large-Scale Benchmark for Language-Conditioned Robotics Manipulation with Long-Horizon Reasoning Tasks

저자: Shiduo Zhang, Zhe Xu, Peiju Liu, Xiaopeng Yu, Yuan Li, Qinghui Gao, Zhaoye Fei, Zhangyue Yin, Zuxuan Wu, Yu-Gang Jiang, Xipeng Qiu | 날짜: 2024-12-24 | URL: https://arxiv.org/abs/2412.18194 📄 PDF


⚠️ 이 페이지의 요약·평가·해설은 생성형 AI(Claude)가 자동 생성한 2차적 분석물입니다. 논문 원문의 저작권은 원저작자에게 있으며, 정확한 내용은 원문(위 DOI·arXiv 등 출처)을 확인하세요.

라이선스: arXiv 비독점 라이선스

Essence

Figure 1

Figure 1. Overview of VLABench. VLABench is a large-scale language-conditioned manipulation benchmark to evaluate the co

VLABench는 Vision-Language-Action 모델의 능력을 평가하기 위해 설계된 대규모 로봇 조작 벤치마크로, 자연어 지시, 상식 이전, 장기 추론이 필요한 100개의 과제를 제공한다.

Motivation

Achievement

Figure 1

Figure 1. Overview of VLABench. VLABench is a large-scale language-conditioned manipulation benchmark to evaluate the co

How

Figure 3

Figure 3. Task examples in each dimension. The first row showcases examples of primitive tasks from Section 3.1, while t

Originality

Limitation & Further Study

Evaluation

Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5

총평: VLABench는 foundation model 기반의 로봇 조작 연구를 평가하기 위한 첫 번째 포괄적 벤치마크로서, 자연언어 지시, 상식 이전, 장기 추론 등 기존 벤치마크가 간과했던 중요한 차원들을 체계적으로 도입했다. 현 SOTA 모델들의 한계를 명확히 드러냄으로써 향후 VLA 및 embodied AI 연구 방향 설정에 중요한 역할을 할 것으로 예상된다.

같이 보면 좋은 논문

기반 연구1621은 로봇 언어 조건 조작의 대규모 벤치마크를 제공하고, 1453에서 학습된 latent plan의 실제 테스트와 비교 평가 기준을 마련한다.
기반 연구BridgeData V2는 대규모 언어 조건 로봇 조작 데이터셋 구축을 위해 참고할 수 있는 실제 데이터 기반 구축 전략을 제시한다.
기반 연구DROID와 같은 대규모 in-the-wild manipulation 데이터셋은 VLABench와 같이 실환경에서 벤치마크 평가를 지원하는 데이터의 이론적 기반이 됨.
기반 연구GR00T N1의 성능을 VLABench의 대규모 벤치마크에서 체계적으로 평가할 수 있습니다.
기반 연구VLABench에선 human/robot demonstrations를 모두 활용한 평가 및 데이터 구축을 통해 Phantom의 human-video 기반 학습법의 일반화를 검증할 수 있다.
기반 연구Dexterous Manipulation through Imitation Learning(1357)은 다양한 벤치마크 기준과 평가 방법론을 다루며, 1621의 언어-조건부 로봇 평가 벤치마크 구성의 참고 문헌이다.
기반 연구VLABench 논문은 diffusion policy 및 VLA 모델의 sim-to-real 성능을 논문 내에서 대규모 벤치마킹을 통해 확장한다.
다른 접근MineDojo(1477)는 마인크래프트 내에서의 오픈엔디드 언어-비전-행동 벤치마크를 제공하여 1621의 실제 로봇 환경 기반 벤치마크와 대상 및 난이도 관점에서 흥미로운 대조점을 제공한다.
다른 접근Perceiver-Actor는 다양한 언어 conditioned robotics manipulation 태스크의 벤치마크 학습 실험을 직접 수행하여 VLABench 벤치마크의 benchmarking 사례로 참고될 수 있음.
다른 접근VLABench 논문은 다양한 language-conditioned robot system의 고장/실패에 대한 벤치마크로 CoPAL의 플래닝 안정성 평가에 참고가 된다.
다른 접근VLABench는 언어조건 로봇 정책의 대규모 벤치마크를 제시하여 EWMBench와 유사한 평가 목적을 가지면서도 평가 포커스와 프로토콜이 다릅니다.
다른 접근Genie Envisioner는 다양한 로봇 태스크 벤치마크와 데이터를 생성함으로써, VLABench와 다른 평가/생성 패러다임을 제공한다.
다른 접근1609가 실제 워크플로우와 적용 가이드를 중심으로 리뷰하는 반면, 1621은 언어 조건부 조작 평가를 위한 벤치마크에 집중하며 VLA의 성능평가 관점을 제공한다.
← 목록으로 돌아가기

🎧 Audio Overview

이 논문 리뷰를 팟캐스트형 오디오로 생성합니다. (Gemini · 키는 브라우저에만 저장 · 완성본은 이메일로도 전송)
▸ 고급: 구성 방향(대본 작성 지침) 직접 수정
속도 1.0x
⬇ MP3 다운로드