저자: Enyu Zhao, Vedant Raval, Hejia Zhang, Jiageng Mao, Zeyu Shangguan, Stefanos Nikolaidis, Yue Wang, Daniel Seita | 날짜: 2025-05-14 | URL: https://arxiv.org/abs/2505.09698 📄 PDF
Essence
Figure 1: ManipBench is a novel benchmark with over 12,000 multiple-choice questions across three different
ManipBench는 Vision-Language Model(VLM)의 저수준 로봇 조작 추론 능력을 평가하기 위한 12,617개의 객관식 문제로 구성된 벤치마크이며, 33개의 VLM을 10개 모델 계열에서 광범위하게 테스트하여 성능 차이를 분석한다.
Evaluation
Novelty: 4/5 Technical Soundness: 3/5 Significance: 4/5 Clarity: 4/5 Overall: 4/5
총평: ManipBench는 VLM의 저수준 로봇 조작 추론 능력을 체계적으로 평가하는 첫 종합 벤치마크로서, 광범위한 모델 평가, 포괄적 작업 범위, 현실 검증을 통해 로봇 조작 분야에 중요한 기여를 한다. 다만 평가 형식의 한계와 실제 로봇 검증의 확장 필요성이 있다.
같이 보면 좋은 논문
기반 연구Learning Transferable Visual Models는 대규모 자연어-비전 데이터로 사전학습된 모델 활용의 이론적 기반을 제공하여 ManipBench의 벤치마크 방식의 토대가 됩니다.
기반 연구ManipBench는 Vision-Language Navigation 연구가 저수준 컨트롤까지 어떻게 확장될 수 있는지를 실제 벤치마크를 통해 보여준다.
기반 연구ManipBench는 언어 조작 벤치마크로, CLIPort의 자연어 명령 기반 조작 정책이 실제 벤치마크에서 어떻게 평가되는지 보여주는 좋은 사례입니다.
기반 연구RT-2는 VLM의 로봇저수준조작 전이 가능성을 검증해
1466의 벤치마크가 측정하는 문제를 실제 모델로 입증한다.
기반 연구ManipBench는 언어·시각 기반 내비게이션 및 조작 모델의 실제 저수준 동작 평가 지표와 벤치마크로서, LLM 기반 navigation 서베이의 참조점이 된다.
기반 연구A Survey on Vision-Language-Action Models for Embodied AI는 다양한 VLA 벤치마크 설계와 평가 기준을 제공하여 ManipBench의 근거가 된다.
기반 연구ManipBench는 LVLM의 low-level spatial manipulation 능력 벤치마크를 제시하여, EmbSpatial-Bench의 공간 이해 평가 프레임워크가 실제로 어떻게 응용되는지 보여줍니다.
기반 연구ManipBench는 다양한 로봇 embodiment와 저수준 조작 과제 벤치마킹이 가능하므로 HPT 모델의 실험적 검증에 적합하다.
기반 연구ManipBench는 다양한 VLA 모델이 실제 저수준 조작까지 얼마나 효과적으로 transfer 가능한지 평가하여, DexVLA의 정책 범용성 실험 근거를 보강합니다.
기반 연구ManipBench는 저수준 매니퓰레이션에서 VLM을 평가하여, EWMBench에서 제안하는 embodied world model 평가에 실제 평가 시나리오를 제공합니다.
기반 연구A Survey on Vision-Language-Action Models: An Action Tokenization Perspective는 다양한 VLM 구조와 벤치마크 방법론을
1466의 관점에서 체계적으로 분석한다.
기반 연구ManipBench(1466)는 다양한 실제 로봇 하드웨어 플랫폼에 대해 cross-embodiment 평가를 제공하여,
1633의 soft-prompted cross-embodiment 설계의 실효성을 점검할 수 있다.
기반 연구ManipBench는 vision-language 모델을 저수준 로봇 제어에 평가하는 벤치마크로, LingBot-VLA 활용·성능 확인에 실질적 평가 환경을 제공한다.
다른 접근CALVIN은 다양한 언어 조건 조작 태스크 벤치마크를 제공해
1466과 유사한 평가 프레임워크로 참고할 만하다.
다른 접근ManipBench 논문은 VLM 기반 로우레벨 정책 평가와 전이를 제공하여 Open X-Embodiment의 범용 정책 성능 평가와 다른 측면을 강조합니다.
다른 접근ManipBench는 Vision-Language 모델의 저수준 액션 수행 역량을 벤치마킹함으로써, 범용 VLA 모델 평가에 대한 다른 접근을 소개합니다.
다른 접근ManipBench는 다양한 낮은 수준 제어 작업에 VLM들을 벤치마킹하여 multi-platform 및 cross-embodiment 성능을 비교할 수 있다.
후속 연구ManipBench는 언어 기반 저수준 로봇 정책 벤치마크를 제공하여 BOSS가 제안하는 skill chaining과 비교해 각 접근법의 실험적 차이를 이해하는 데 도움이 됩니다.
후속 연구ManipBench는 vision-language 모델의 저레벨 저작 및 평가 프레임워크를 제공하므로, NavDP의 diffusion 기반 네비게이션 정책 평가와 이론적으로 연결됩니다.
응용 사례robosuite는 다양한 시뮬레이션 환경을 제공하며, ManipBench에서 다양한 저수준 VLM을 실제 로봇/제어 환경에서 평가하는 데 적극 활용될 수 있습니다.